跳转到内容

整合算法

快速概览

本页是多组学整合的算法地图:从 K 个组学矩阵出发,提取共享低维表示与组学特异分量。四类方法对应不同的样本规模、缺失程度与可解释性权衡,选型的关键是匹配数据条件而非追求复杂度。

  • 共享表示是核心输出:Joint NMF 通过共享基矩阵 W 强制各组学在样本维度对齐,CCA 则直接最大化跨组学线性相关
  • MOFA+ 用 ARD 先验从数据自动学习各组学-因子权重,变分推断可处理缺失值并给出后验不确定性,是小样本、可解释场景的首选
  • 选型逻辑:小样本+可解释选 Joint NMF/MOFA+,缺失多选 MOFA+/scVI,复杂非线性选 VAE/GNN/Transformer——简单方法在小数据上往往更稳健

多组学整合算法(Multi-Omics Integration Algorithms) 旨在联合分析来自不同生物学层次的数据,发现跨组学的共享模式与特异信号。

输入

  • KK 个组学数据矩阵:X(1),X(2),...,X(K)X^{(1)}, X^{(2)}, ..., X^{(K)}
  • 其中 X(k)Rn×pkX^{(k)} \in \mathbb{R}^{n \times p_k}Rnk×pk\mathbb{R}^{n_k \times p_k}(允许样本不匹配)
  • 可选:样本标签、批次信息、先验知识

输出

  • 共享的低维表示:ZRr×nZ \in \mathbb{R}^{r \times n} 或样本映射
  • 组学特异分量:各组学独有的变异模式
  • 跨组学关联:特征层面的对应关系

| 挑战类型 | 具体问题 | 算法应对策略 | |---------|---------|-------------| | 异质性 | 不同组学的维度、分布、噪声模式差异巨大 | 标准化、概率建模、深度网络 | | 对齐性 | 样本是否匹配、细胞是否对应 | 显式对齐、隐式嵌入匹配 | | 可解释性 | 识别跨组学驱动因子 | 稀疏约束、因子标注、网络分析 | | 可扩展性 | 大规模数据处理 | 随机优化、分块计算、近似推断 |

基本思想:对多个组学矩阵共享部分因子矩阵,强制它们在低维空间对齐。

给定 KK 个组学矩阵 X(1),X(2),...,X(K)X^{(1)}, X^{(2)}, ..., X^{(K)},Joint NMF 优化:

minW,H(1),...,H(K)k=1KX(k)WH(k)F2+λR(W,H)\min_{W, H^{(1)}, ..., H^{(K)}} \sum_{k=1}^{K} \|X^{(k)} - W H^{(k)}\|_F^2 + \lambda \mathcal{R}(W, H)

其中 WW 是共享的基矩阵(n×rn \times r),H(k)H^{(k)} 是各组学特异的系数矩阵(r×pkr \times p_k)。共享 WW 即自动实现各组学在样本维度的对齐,WW 的列可解释为共同的生物学过程(通路、细胞类型、疾病亚型)。

求解:目标函数非凸,通常用交替乘法更新(multiplicative update)求局部最优:

WijWijk(X(k)(H(k))T)ijk(WH(k)(H(k))T)ij,Hij(k)Hij(k)(WTX(k))ij(WTWH(k))ijW_{ij} \leftarrow W_{ij} \cdot \frac{\sum_k (X^{(k)} (H^{(k)})^T)_{ij}}{\sum_k (W H^{(k)} (H^{(k)})^T)_{ij}}, \qquad H^{(k)}_{ij} \leftarrow H^{(k)}_{ij} \cdot \frac{(W^T X^{(k)})_{ij}}{(W^T W H^{(k)})_{ij}}

正则项 R\mathcal{R} 常用 L2、稀疏(L1)或组间一致性约束 k<lH(k)H(l)F2\sum_{k<l}\|H^{(k)}-H^{(l)}\|_F^2

优点

  • 数学形式清晰,易于解释
  • 非负约束符合生物学直觉("部分组成整体")
  • 计算效率较高,适合中小规模数据

缺点

  • 难以处理缺失数据
  • 对初始化敏感(非凸,需多次运行取优)
  • 要求数据非负(z-score 等含负值数据需先变换)

适用场景:样本匹配、规模中等(n<104n < 10^4)、需要可解释因子、数据为非负计数/丰度的场景。

变体

  • iNMF:整合单细胞多模态数据,加入对齐约束并可处理部分模态缺失
  • MultiNMF:加入组学权重 wkw_k 控制各组学贡献,可自动学习
  • SNF(Similarity Network Fusion):构建相似性网络后融合(见下文图方法)

基本思想:寻找两组变量的线性组合,使它们之间的相关性最大化。

对两组数据 XRn×pX \in \mathbb{R}^{n \times p}YRn×qY \in \mathbb{R}^{n \times q},求解:

maxu,vuTXTYvs.t.uTXTXu=1,vTYTYv=1\max_{u, v} u^T X^T Y v \quad \text{s.t.} \quad u^T X^T X u = 1, v^T Y^T Y v = 1

约束保证典型变量(canonical variate)方差为 1,避免平凡解。

求解:可转化为广义特征值问题。令 Σxx=XTX\Sigma_{xx}=X^TXΣyy=YTY\Sigma_{yy}=Y^TYΣxy=XTY\Sigma_{xy}=X^TY,计算 M=Σxx1ΣxyΣyy1ΣyxM=\Sigma_{xx}^{-1}\Sigma_{xy}\Sigma_{yy}^{-1}\Sigma_{yx},其特征值 λk\lambda_k 给出典型相关系数 ρk=λk\rho_k=\sqrt{\lambda_k},可依次求得 r=min(p,q)r=\min(p,q) 对互不相关的典型变量。显著性可用 Wilks' Lambda Λ=i(1ρi2)\Lambda=\prod_i(1-\rho_i^2) 或置换检验评估。

扩展方法

  • Sparse CCA:加入 L1 正则 maxwxTΣxywyλxwx1λywy1\max\, w_x^T\Sigma_{xy}w_y-\lambda_x\|w_x\|_1-\lambda_y\|w_y\|_1 实现特征选择
  • Kernel CCA:通过核函数处理非线性关系
  • Group CCA:扩展到多组学(>2 组)
  • Deep CCA:使用深度网络学习非线性映射 maxf,gCorr(f(X),g(Y))\max_{f,g}\mathrm{Corr}(f(X),g(Y))

优点

  • 理论基础扎实
  • 直接优化跨组学相关性
  • 可扩展到多组学场景

缺点

  • 线性 CCA 难以捕捉复杂非线性关系
  • 对噪声敏感,标准 CCA 不能处理缺失数据
  • 样本量要求较高(n>p+qn > p+q

适用场景:两组匹配样本、线性关联假设合理、需要可解释权重的关联发现。CCA 最大化线性相关的思想也是现代对比学习(如 CLIP)与多模态表示学习的源头之一。

核心思想:假设观测到的多组学数据由一组共享的潜在因子驱动,每组学对这些因子有不同的敏感度。

模型结构:

X(k)=W(k)Z+ϵ(k),ϵ(k)N(0,τ(k))X^{(k)} = W^{(k)} Z + \epsilon^{(k)}, \quad \epsilon^{(k)} \sim \mathcal{N}(0, \tau^{(k)})

其中:

  • ZRr×nZ \in \mathbb{R}^{r \times n} 是共享潜在因子
  • W(k)W^{(k)} 是组学 kk 的因子载荷矩阵
  • τ(k)\tau^{(k)} 是组学 kk 的噪声参数

ARD 先验与自动权重学习:对载荷设自动相关性确定(Automatic Relevance Determination, ARD)先验 Wjr(k)N(0,αkr1)W^{(k)}_{jr}\sim\mathcal{N}(0,\alpha_{kr}^{-1})。精度 αkr\alpha_{kr} 越小,因子 rr 对组学 kk 越重要,从而由数据自动学习各组学-因子的权重,无需手工指定。

推断方法:后验 p(Z,WX)p(Z,W\mid X) 难以精确计算,采用变分推断,以因子化近似 q(Z,W)=q(Z)kq(W(k))q(Z,W)=q(Z)\prod_k q(W^{(k)}) 最大化证据下界(Evidence Lower Bound, ELBO):

L=Eq[logp(X,Z,W)]Eq[logq(Z,W)]\mathcal{L}=\mathbb{E}_q[\log p(X,Z,W)]-\mathbb{E}_q[\log q(Z,W)]

优点

  • 可处理缺失数据(直接标记 NA,无需填充)
  • 提供不确定性估计(后验分布)
  • 可解释性强(因子可标注为生物学过程)
  • 支持视图权重自动学习与多种数据类型(连续/二值/计数)

缺点

  • 假设因子服从正态分布
  • 计算复杂度随样本量增长,推断较慢
  • 需要选择因子数量(可用 ELBO 曲线或方差解释率)

适用场景:存在缺失数据、需要不确定性估计、样本量较小或数据类型多样的队列级多组学整合。

代表方法

  • scVI / totalVI / MultiVI:单细胞多模态整合
  • MOFA+ 的 VAE 版本:更灵活的分布假设

基本架构

  1. 编码器:将观测数据映射到潜在空间
  2. 潜在变量:学习共享表示
  3. 解码器:从潜在空间重构各组学数据

优点

  • 可处理非线性关系
  • 灵活的分布假设
  • 可扩展到大规模数据
  • 可整合批次信息

缺点

  • 训练不稳定
  • 超参数敏感
  • 可解释性较弱

基本思想:不假设数据分布,把每组学数据转化为样本相似性网络,再通过迭代消息传递融合成一张网络,用于下游聚类/可视化。

基本流程

  1. 为每组学构建样本相似性网络。用热核(heat kernel)加局部缩放定义相似度,并做行归一化得到随机矩阵: Wij=exp ⁣(dij2μϵiϵj),Pij=WijlWilW_{ij}=\exp\!\left(-\frac{d_{ij}^2}{\mu\,\epsilon_i\epsilon_j}\right), \qquad P_{ij}=\frac{W_{ij}}{\sum_l W_{il}} 其中 dijd_{ij} 为欧氏距离,ϵi\epsilon_i 取样本 ii 到第 KK 个近邻的距离,μ\mu 为超参数。
  2. 迭代融合网络(S(k)S^{(k)}P(k)P^{(k)} 的对称化版本): P(k)S(k)×(lkP(l)K1)×(S(k))TP^{(k)} \leftarrow S^{(k)} \times \left(\frac{\sum_{l \neq k} P^{(l)}}{K-1}\right) \times (S^{(k)})^T
  3. 融合后的网络用于下游分析(谱聚类、可视化)。

优点

  • 不假设数据分布,可处理不同类型的数据
  • 网络表示直观、易于可视化
  • 算法简单直观,对噪声相对鲁棒

缺点

  • 相似性度量选择影响结果
  • 难以处理缺失数据
  • 计算复杂度 O(n2)O(n^2)(融合每轮 O(Kn3)O(Kn^3)),不适合超大规模

适用场景:样本量中等(n<5000n<5000)、数据类型多样、需要样本层面(而非特征层面)整合与网络表示的场景。

基本思想:将样本作为节点,组学信息作为节点特征,通过消息传递学习整合表示。

代表方法

  • scMoGNN:单细胞多组学图神经网络
  • MOMA:多组学图注意力网络

优点

  • 可捕捉复杂的样本间关系
  • 可整合先验知识(如蛋白质相互作用)
  • 端到端学习

缺点

  • 需要构建合理的图结构
  • 计算开销大
  • 可解释性挑战

架构类型

  1. 早期融合自编码器:输入拼接后编码
  2. 多编码器-解码器:各模态独立编码,在瓶颈层融合
  3. 对比学习:学习跨模态对齐的表示

损失函数

  • 重构损失:kX(k)X^(k)2\sum_k \|X^{(k)} - \hat{X}^{(k)}\|^2
  • 对比损失:拉近正样本对,推开负样本对
  • 正则项:鼓励稀疏或低维表示

应用场景

  • 单细胞多模态:scJoint、scMoMaT
  • 时空组学整合:SpaGCN、STAGATE

优势

  • 注意力机制捕捉长程依赖
  • 可处理可变长度输入
  • 预训练-微调范式

| 场景 | 推荐算法 | 理由 | |------|----------|------| | 小样本、可解释性要求高 | Joint NMF, MOFA+ | 计算快,因子可解释 | | 缺失数据较多 | MOFA+, scVI | 可处理缺失值 | | 非线性关系复杂 | VAE, GNN, Transformer | 捕捉复杂模式 | | 大规模数据 | scVI, Linear CCA | 可扩展性好 | | 需要不确定性估计 | MOFA+, scVI | 贝叶斯框架 | | 单细胞多模态 | scVI, totalVI, MultiVI | 专为单细胞设计 |

  • 标准化:每组学独立标准化(z-score 或 min-max)
  • 特征选择:保留高变异特征或生物学相关特征
  • 缺失值处理:根据算法选择填零、均值或模型推断
  • 潜在维度:使用肘部法则、解释方差或下游任务性能
  • 正则强度:交叉验证或信息准则(AIC/BIC)
  • 学习率:深度学习方法需要调优
  • 重构误差:衡量信息保留
  • 跨模态一致性:如标签一致性、相关性
  • 下游任务性能:分类、聚类、差异表达
  • 可解释性:因子与已知生物学通路的重叠