多组学整合
多组学整合(Multi-Omics Integration)旨在联合分析来自不同生物学层次的数据(基因组、转录组、蛋白质组、表观组等),建立比单一组学更完整的生物学解释。单一组学各有盲区(基因组看不到功能状态、转录组难分因果、蛋白组受转录后调控影响),整合的价值在于互补验证、构建 DNA → RNA → 蛋白 → 表型的因果链条,并发现单一组学无法看到的跨层关联。各组学局限性的展开见 整合策略。
本章按"数据层 → 策略层 → 算法层 → 应用层"组织:
多组学数据 → 整合策略 → 核心算法 → 生物学发现批次校正 早/中/晚期 矩阵分解 疾病分型单细胞多模态 整合方案 因子/图/深度 机制推断- 整合策略 — 理解早期/中期/后期整合的基本思想与选择原则
- 批次效应与数据协调 — 学习批次效应识别与校正
- 单细胞 multiome — 了解同一细胞的多模态分析
- 整合算法 — 掌握矩阵分解(Joint NMF)、相关性(CCA)、因子分析(MOFA+)与图方法(SNF)等核心算法
本章核心问题
Section titled “本章核心问题”多组学整合需要回答的关键问题:
- 整合时机:早期、中期还是后期整合?
- 对齐策略:如何处理样本不匹配、批次效应?
- 方法选择:矩阵分解、概率模型还是深度网络?
- 结果评估:如何验证整合后的生物学发现?