Skip to content

物种分类分析

物种分类模块识别并定量分析宏基因组样本中的微生物种类,将清洗后的读段转换为分类学证据。

概述

模块执行三步:Kraken2 分类 -> kraken-biom 转换 -> Krona 可视化。

  • Kraken2:基于 k-mer 的快速分类
  • kraken-biom:将报告转换为 BIOM 格式供下游分析
  • Krona:生成交互式分类组成图

工作流程

输入要求

格式扩展名说明
FASTQ (gzip).fastq.gzKneadData 清洗后的配对读段
FASTQ.fastqKneadData 清洗后的配对读段

输入目录通常是 results/quality_control/kneaddata/,模块通过 Sample.discover_cleaned() 自动发现 *_paired_1.fastq / *_paired_2.fastq 文件。

运行分析

完整流程

bash
micos full-run \
  --input-dir data/raw_input \
  --results-dir results \
  --threads 16 \
  --kneaddata-db /path/to/kneaddata_db \
  --kraken2-db /path/to/kraken2_db

仅物种分类

bash
micos run taxonomic-profiling \
  --input-dir results/quality_control/kneaddata \
  --output-dir results/taxonomic_profiling \
  --threads 16 \
  --kraken2-db /path/to/kraken2_db \
  --confidence 0.1

置信度阈值

灵敏度精确度适用场景
0.0很高较低探索性分析
0.1良好默认,平衡
0.3中等保守分析
0.5很高仅高置信度

输出文件

results/taxonomic_profiling/
├── sample1.kraken          # Kraken2 原始分类输出
├── sample1.report          # Kraken2 分类报告
├── sample1.krona.html      # Krona 交互式分类视图
└── feature-table.biom      # 合并所有样本的 BIOM 丰度表

feature-table.biom 是多样性分析的输入。

结果解读

分类率

分类率解读操作
< 50%高未分类率检查数据库覆盖度,考虑降低置信度
50-70%中等大多数分析可接受
70-90%良好标准性能
> 90%优秀高质量数据和良好数据库覆盖

意外的高丰度物种可能指示污染,分类分布的异常偏斜需要调查。

相关文档

MICOS-2024 宏基因组分析平台