基础与数学
生物信息学的很多问题都可以抽象成对序列、图、矩阵和概率模型的计算。但在进入算法之前,先要明确几个基本对象:
- 序列是什么;
- 读段和参考基因组是什么;
- coverage、错误模型和坐标系统怎样影响后续分析;
- 注释和特征区间如何把序列映射到生物学对象;
- 为什么图模型、动态规划和概率模型会反复出现。
这一节是整站的对象层与方法入口——后面的索引、比对、组装、变异检测、转录组分析几乎都依赖这里的术语和直觉。如果这层基础不稳,读者很容易只记住工具名和术语,而无法理解输入输出对应什么对象、某个方法为什么适合这个问题、错误和不确定性从哪里进入流程。
起点
生物信息学中的基础对象
先建立 DNA、RNA、蛋白质、基因组、reads 和注释等基本对象的整体认识。
进入子主题 基础
序列、字符串与坐标系统
把生物对象和字符串表示、坐标系、区间概念连接起来。
进入子主题 核心
测序 reads、coverage 与错误模型
理解原始观测如何影响后续比对、组装、变异检测与定量。
进入子主题 关键
参考基因组、坐标系统与注释
建立参考版本、注释层级与坐标系统的基本直觉。
进入子主题 衔接
概率、图与动态规划预备
为后续比对、组装和概率模型页建立共通数学语言。
进入子主题 总纲
算法与复杂度
从穷举、DP、图算法、索引到随机化方法,建立整站的算法主线。
进入子主题