跳转到内容

批次效应与数据协调

快速概览

批次效应是多组学整合最易失败的环节:技术变异让样本按平台而非按生物学状态聚类。本页给出校正目标的形式化分解、四类主流方法,以及从批次去除与生物学保留两侧评估校正质量的指标体系。

  • 校正目标即分解 X = B + S + ε:去除技术批次 B 的同时保留生物信号 S;批次去除、生物学保留、避免过校正三个目标存在内在张力
  • 方法谱系:ComBat(经验贝叶斯线性模型,估计加性与乘性批次效应)、Harmony(嵌入空间迭代校正)、MNN(相互最近邻校正向量,不依赖批次标签)、scVI/MOFA+(概率建模分离共享与批次特异因子)
  • 评估必须双侧进行:kBET/批次熵查批次去除,细胞类型纯度/silhouette 查生物学保留,还需用混合指数与伪时间相关性检测过校正

批次效应(Batch Effect) 指由于技术因素而非生物学因素导致的系统差异。这些因素包括:

  • 实验平台差异:不同测序仪、芯片或质谱仪
  • 操作批次差异:不同日期、不同操作人员
  • 试剂差异:不同批号试剂、不同文库制备方案
  • 处理条件差异:温度、时间等实验条件波动

设观测数据 XRn×pX \in \mathbb{R}^{n \times p} 由两部分组成:

X=B+S+ϵX = B + S + \epsilon

其中:

  • BB 为批次效应(技术变异)
  • SS 为真实生物学信号
  • ϵ\epsilon 为随机噪声

批次校正的目标是估计并去除 BB,同时保留 SS

多组学整合最易失败的环节往往不是模型复杂度不足,而是批次效应掩盖了真实的生物学信号。具体表现为:

| 问题类型 | 具体表现 | 后果 | |---------|---------|------| | 平台差异 | 不同测序平台的数据分布不同 | 样本按平台聚类而非按生物学状态聚类 | | 时间批次 | 不同日期处理的样本呈现系统偏移 | 假阳性差异信号 | | 操作差异 | 不同技术人员引入的系统性偏差 | 技术伪迹被误认为生物学信号 |

数据协调(Data Harmonization)旨在实现以下三个目标:

确保同一生物学群体内的样本不因技术批次而聚类分离。

不同细胞类型、疾病状态等生物学差异应保持可分辨。

不应将真实的生物学信号误判为批次效应而消除。

这三个目标之间存在内在张力:

  • 过度追求批次消除 \rightarrow 可能抹去生物学差异
  • 过度保留生物学差异 \rightarrow 可能残留批次效应
  • 校正不足或过度 \rightarrow 下游分析均受影响

ComBat(Empirical Bayes framework)

假设批次效应可用线性模型描述:

Yijg=αg+Xijβg+γig+δigY~ijg+ϵijgY_{ijg} = \alpha_g + X_{ij}\beta_g + \gamma_{ig} + \delta_{ig}\tilde{Y}_{ijg} + \epsilon_{ijg}

其中:

  • γig\gamma_{ig}:批次 ii 对基因 gg 的加性效应
  • δig\delta_{ig}:批次 ii 对基因 gg 的乘性效应
  • Y~ijg\tilde{Y}_{ijg}:标准化后的表达值

Harmony

在高维嵌入空间迭代修正批次效应:

  1. 初始降维(PCA)
  2. 软聚类:估计细胞属于各群体的概率
  3. 线性校正:在每个群体内部校正批次效应
  4. 迭代至收敛

相互最近邻(MNN, Mutual Nearest Neighbors)

假设不同批次间存在共享的生物学群体:

  1. 在各批次间识别相互最近邻对
  2. 计算批次间的"校正向量"
  3. 应用校正向量对齐批次

scVI / totalVI / MultiVI

使用变分自编码器同时建模:

  • 共享的潜在生物学状态 zz
  • 批次特异的噪声参数
  • 组学特异的生成过程

MOFA+

明确分离共享因子与批次特异因子:

X(k)=W(k)Z+Wbatch(k)Zbatch+ϵ(k)X^{(k)} = W^{(k)} Z + W_{\text{batch}}^{(k)} Z_{\text{batch}} + \epsilon^{(k)}

通过贝叶斯推断自动学习各因子的重要性。

有效的数据协调评估需从多个维度进行:

| 维度 | 指标 | 评估目标 | |-----|------|---------| | 批次去除 | kBET、批次熵 | 样本是否按批次聚类 | | 生物学保留 | 细胞类型纯度、 silhouette score | 生物学标签是否可分辨 | | 下游任务 | 差异表达一致性、轨迹连续性 | 下游分析是否合理 | | 过校正检测 | 细胞类型混合度、伪时间偏移 | 是否过度混合不同群体 |

批次效应检测

  • kBET(k-nearest neighbor Batch Effect Test):检验近邻中批次分布是否均匀
  • 批次熵(Batch Entropy):衡量局部邻域的批次多样性

生物学保留

  • 细胞类型纯度(Cell Type Purity):校正后同簇内细胞类型一致性
  • Silhouette Width:衡量簇内紧凑性与簇间分离度

过校正检测

  • 细胞类型混合指数(Cell Type Mixing Index)
  • 伪时间相关性(Pseudotime Correlation)

| 场景 | 推荐方法 | 理由 | |-----|---------|------| | 已知批次标签,样本量中等 | ComBat、Harmony | 计算高效,校正效果稳定 | | 单细胞多组学整合 | scVI、totalVI、MultiVI | 专为单细胞设计,可处理多模态 | | 需要不确定性估计 | MOFA+ | 贝叶斯框架,提供后验分布 | | 批次-生物学耦合 | MNN | 不依赖批次标签,基于共享群体 | | 大规模数据 | Harmony、scVI | 可扩展性好 |