整合算法
本页是多组学整合的算法地图:从 K 个组学矩阵出发,提取共享低维表示与组学特异分量。四类方法对应不同的样本规模、缺失程度与可解释性权衡,选型的关键是匹配数据条件而非追求复杂度。
- 共享表示是核心输出:Joint NMF 通过共享基矩阵 W 强制各组学在样本维度对齐,CCA 则直接最大化跨组学线性相关
- MOFA+ 用 ARD 先验从数据自动学习各组学-因子权重,变分推断可处理缺失值并给出后验不确定性,是小样本、可解释场景的首选
- 选型逻辑:小样本+可解释选 Joint NMF/MOFA+,缺失多选 MOFA+/scVI,复杂非线性选 VAE/GNN/Transformer——简单方法在小数据上往往更稳健
什么是多组学整合算法
Section titled “什么是多组学整合算法”多组学整合算法(Multi-Omics Integration Algorithms) 旨在联合分析来自不同生物学层次的数据,发现跨组学的共享模式与特异信号。
输入:
- 个组学数据矩阵:
- 其中 或 (允许样本不匹配)
- 可选:样本标签、批次信息、先验知识
输出:
- 共享的低维表示: 或样本映射
- 组学特异分量:各组学独有的变异模式
- 跨组学关联:特征层面的对应关系
| 挑战类型 | 具体问题 | 算法应对策略 | |---------|---------|-------------| | 异质性 | 不同组学的维度、分布、噪声模式差异巨大 | 标准化、概率建模、深度网络 | | 对齐性 | 样本是否匹配、细胞是否对应 | 显式对齐、隐式嵌入匹配 | | 可解释性 | 识别跨组学驱动因子 | 稀疏约束、因子标注、网络分析 | | 可扩展性 | 大规模数据处理 | 随机优化、分块计算、近似推断 |
矩阵分解类算法
Section titled “矩阵分解类算法”联合非负矩阵分解(Joint NMF)
Section titled “联合非负矩阵分解(Joint NMF)”基本思想:对多个组学矩阵共享部分因子矩阵,强制它们在低维空间对齐。
给定 个组学矩阵 ,Joint NMF 优化:
其中 是共享的基矩阵(), 是各组学特异的系数矩阵()。共享 即自动实现各组学在样本维度的对齐, 的列可解释为共同的生物学过程(通路、细胞类型、疾病亚型)。
求解:目标函数非凸,通常用交替乘法更新(multiplicative update)求局部最优:
正则项 常用 L2、稀疏(L1)或组间一致性约束 。
优点:
- 数学形式清晰,易于解释
- 非负约束符合生物学直觉("部分组成整体")
- 计算效率较高,适合中小规模数据
缺点:
- 难以处理缺失数据
- 对初始化敏感(非凸,需多次运行取优)
- 要求数据非负(z-score 等含负值数据需先变换)
适用场景:样本匹配、规模中等()、需要可解释因子、数据为非负计数/丰度的场景。
变体:
- iNMF:整合单细胞多模态数据,加入对齐约束并可处理部分模态缺失
- MultiNMF:加入组学权重 控制各组学贡献,可自动学习
- SNF(Similarity Network Fusion):构建相似性网络后融合(见下文图方法)
典型相关分析(CCA)及扩展
Section titled “典型相关分析(CCA)及扩展”基本思想:寻找两组变量的线性组合,使它们之间的相关性最大化。
对两组数据 和 ,求解:
约束保证典型变量(canonical variate)方差为 1,避免平凡解。
求解:可转化为广义特征值问题。令 、、,计算 ,其特征值 给出典型相关系数 ,可依次求得 对互不相关的典型变量。显著性可用 Wilks' Lambda 或置换检验评估。
扩展方法:
- Sparse CCA:加入 L1 正则 实现特征选择
- Kernel CCA:通过核函数处理非线性关系
- Group CCA:扩展到多组学(>2 组)
- Deep CCA:使用深度网络学习非线性映射
优点:
- 理论基础扎实
- 直接优化跨组学相关性
- 可扩展到多组学场景
缺点:
- 线性 CCA 难以捕捉复杂非线性关系
- 对噪声敏感,标准 CCA 不能处理缺失数据
- 样本量要求较高()
适用场景:两组匹配样本、线性关联假设合理、需要可解释权重的关联发现。CCA 最大化线性相关的思想也是现代对比学习(如 CLIP)与多模态表示学习的源头之一。
因子分析类算法
Section titled “因子分析类算法”MOFA+(Multi-Omics Factor Analysis)
Section titled “MOFA+(Multi-Omics Factor Analysis)”核心思想:假设观测到的多组学数据由一组共享的潜在因子驱动,每组学对这些因子有不同的敏感度。
模型结构:
其中:
- 是共享潜在因子
- 是组学 的因子载荷矩阵
- 是组学 的噪声参数
ARD 先验与自动权重学习:对载荷设自动相关性确定(Automatic Relevance Determination, ARD)先验 。精度 越小,因子 对组学 越重要,从而由数据自动学习各组学-因子的权重,无需手工指定。
推断方法:后验 难以精确计算,采用变分推断,以因子化近似 最大化证据下界(Evidence Lower Bound, ELBO):
优点:
- 可处理缺失数据(直接标记 NA,无需填充)
- 提供不确定性估计(后验分布)
- 可解释性强(因子可标注为生物学过程)
- 支持视图权重自动学习与多种数据类型(连续/二值/计数)
缺点:
- 假设因子服从正态分布
- 计算复杂度随样本量增长,推断较慢
- 需要选择因子数量(可用 ELBO 曲线或方差解释率)
适用场景:存在缺失数据、需要不确定性估计、样本量较小或数据类型多样的队列级多组学整合。
变分自编码器(VAE)类方法
Section titled “变分自编码器(VAE)类方法”代表方法:
- scVI / totalVI / MultiVI:单细胞多模态整合
- MOFA+ 的 VAE 版本:更灵活的分布假设
基本架构:
- 编码器:将观测数据映射到潜在空间
- 潜在变量:学习共享表示
- 解码器:从潜在空间重构各组学数据
优点:
- 可处理非线性关系
- 灵活的分布假设
- 可扩展到大规模数据
- 可整合批次信息
缺点:
- 训练不稳定
- 超参数敏感
- 可解释性较弱
相似性网络融合(SNF)
Section titled “相似性网络融合(SNF)”基本思想:不假设数据分布,把每组学数据转化为样本相似性网络,再通过迭代消息传递融合成一张网络,用于下游聚类/可视化。
基本流程:
- 为每组学构建样本相似性网络。用热核(heat kernel)加局部缩放定义相似度,并做行归一化得到随机矩阵: 其中 为欧氏距离, 取样本 到第 个近邻的距离, 为超参数。
- 迭代融合网络( 为 的对称化版本):
- 融合后的网络用于下游分析(谱聚类、可视化)。
优点:
- 不假设数据分布,可处理不同类型的数据
- 网络表示直观、易于可视化
- 算法简单直观,对噪声相对鲁棒
缺点:
- 相似性度量选择影响结果
- 难以处理缺失数据
- 计算复杂度 (融合每轮 ),不适合超大规模
适用场景:样本量中等()、数据类型多样、需要样本层面(而非特征层面)整合与网络表示的场景。
图神经网络(GNN)方法
Section titled “图神经网络(GNN)方法”基本思想:将样本作为节点,组学信息作为节点特征,通过消息传递学习整合表示。
代表方法:
- scMoGNN:单细胞多组学图神经网络
- MOMA:多组学图注意力网络
优点:
- 可捕捉复杂的样本间关系
- 可整合先验知识(如蛋白质相互作用)
- 端到端学习
缺点:
- 需要构建合理的图结构
- 计算开销大
- 可解释性挑战
深度学习方法
Section titled “深度学习方法”多模态自编码器
Section titled “多模态自编码器”架构类型:
- 早期融合自编码器:输入拼接后编码
- 多编码器-解码器:各模态独立编码,在瓶颈层融合
- 对比学习:学习跨模态对齐的表示
损失函数:
- 重构损失:
- 对比损失:拉近正样本对,推开负样本对
- 正则项:鼓励稀疏或低维表示
Transformer 架构
Section titled “Transformer 架构”应用场景:
- 单细胞多模态:scJoint、scMoMaT
- 时空组学整合:SpaGCN、STAGATE
优势:
- 注意力机制捕捉长程依赖
- 可处理可变长度输入
- 预训练-微调范式
算法选择指南
Section titled “算法选择指南”| 场景 | 推荐算法 | 理由 | |------|----------|------| | 小样本、可解释性要求高 | Joint NMF, MOFA+ | 计算快,因子可解释 | | 缺失数据较多 | MOFA+, scVI | 可处理缺失值 | | 非线性关系复杂 | VAE, GNN, Transformer | 捕捉复杂模式 | | 大规模数据 | scVI, Linear CCA | 可扩展性好 | | 需要不确定性估计 | MOFA+, scVI | 贝叶斯框架 | | 单细胞多模态 | scVI, totalVI, MultiVI | 专为单细胞设计 |
实现注意事项
Section titled “实现注意事项”- 标准化:每组学独立标准化(z-score 或 min-max)
- 特征选择:保留高变异特征或生物学相关特征
- 缺失值处理:根据算法选择填零、均值或模型推断
- 潜在维度:使用肘部法则、解释方差或下游任务性能
- 正则强度:交叉验证或信息准则(AIC/BIC)
- 学习率:深度学习方法需要调优
- 重构误差:衡量信息保留
- 跨模态一致性:如标签一致性、相关性
- 下游任务性能:分类、聚类、差异表达
- 可解释性:因子与已知生物学通路的重叠