18
宏基因组测序
2024/3/19
宏基因组测序介绍及核心生信分析图
宏基因组测序(Metagenomic Sequencing)是对特定环境样本中 全部微生物(细菌、古菌、真菌、病毒等)的总 DNA 进行无靶向高通量测序,无需分离培养单个微生物,即可全面解析样本中微生物的 物种组成、基因功能、代谢通路及互作网络。其核心优势是 “无偏性” 和 “全面性”,不仅能揭示微生物群落的物种多样性,还能深入挖掘功能潜力,广泛应用于肠道微生物、环境生态、农业土壤、工业发酵、疾病诊断等领域。
一、宏基因组测序核心基础
1. 技术原理与核心特点
-
核心逻辑:直接提取环境样本(如肠道粪便、土壤、水体)中的总微生物 DNA,构建基因组文库后进行高通量测序(Illumina NovaSeq/HiSeq、PacBio HiFi、Nanopore 等平台),通过生物信息学分析拼接微生物基因组、注释物种和功能。
-
与扩增子测序的区别:
|
对比维度
|
宏基因组测序
|
扩增子测序
|
|
测序对象
|
全部微生物总 DNA(无靶向)
|
特定目标基因(如 16S rRNA、ITS)
|
|
物种覆盖
|
细菌、古菌、真菌、病毒、原生生物(全面)
|
仅目标基因对应的类群(如 16S 对应原核)
|
|
核心产出
|
物种组成 + 基因功能 + 代谢通路 + 微生物基因组(MAGs)
|
物种组成 + 多样性(无直接功能信息)
|
|
优势
|
无偏性、功能解析深入、可组装微生物基因组
|
成本低、周期短、物种分类快速
|
|
适用场景
|
功能机制研究、新物种挖掘、复杂群落解析
|
大规模样本筛查、物种多样性快速评估
|
2. 核心分析流程
-
样本处理:提取微生物总 DNA(需保证纯度和完整性,避免宿主 DNA 污染);
-
文库构建:打断 DNA 片段(Illumina 平台常用 350bp 插入片段),连接接头和 barcode;
-
高通量测序:生成短读长(Illumina)或长读长(PacBio/Nanopore)测序数据;
-
生信分析核心步骤:
-
数据质控:过滤低质量序列、宿主 DNA(如人源、植物源)、污染序列;
-
序列组装:拼接 contig/scaffold(可选择 “组装后分箱” 或 “分箱后组装”);
-
微生物分箱(Binning):将拼接序列分配到不同微生物基因组(MAGs,宏基因组组装基因组);
-
物种注释:基于 MAGs 或 reads 直接比对,实现门到种水平的物种分类;
-
功能注释:注释基因的 COG/KOG、KEGG、CAZy、VFDB(毒力因子)等功能数据库;
-
差异分析:比较分组间的物种丰度、功能基因丰度、代谢通路差异。
3. 核心分析目标
-
物种全景:样本中所有可检测微生物的种类、丰度及分布(含难培养 / 未培养微生物);
-
功能解析:微生物群落携带的功能基因库、核心代谢通路(如碳代谢、氮循环、耐药基因);
-
基因组挖掘:组装高质量 MAGs(完成度≥90%,污染率≤5%),发现新物种或功能菌株;
-
差异机制:不同分组(如健康 vs 疾病、处理 vs 对照)的物种 / 功能差异及关联机制。
二、宏基因组测序核心生信分析图(按分析逻辑分类)
(一)数据质控与预处理图(验证数据可靠性)
用于筛选高质量数据、去除干扰(宿主污染、低质量序列),为后续组装和注释奠定基础。
-
测序数据质量分布图(FastQC/Trimmomatic 图)
-
核心用途:评估原始测序数据的碱基质量、GC 含量、接头污染情况。
-
解读要点:
-
碱基质量值(纵轴):所有位置 Phred 质量值≥20(合格),≥30(优质),避免末端低质量序列影响组装;
-
GC 含量分布(辅助图):若出现异常峰(如宿主 DNA 的 GC 峰),提示需加强宿主去除;
-
接头污染:Adapter 含量需≤1%(超标需用 Cutadapt 工具去除)。
-
示例:Illumina NovaSeq 测序数据,150bp 读长的前 120bp 质量值≥30,末端 30bp 质量值≥25,无明显接头污染,数据合格。
-
宿主 DNA 去除效率图
-
核心用途:展示宿主(如人、小鼠、植物)DNA 的去除效果(宏基因组样本常含宿主污染,需优先去除)。
-
解读要点:常用饼图或柱状图展示 “去除前宿主 DNA 占比” 与 “去除后占比”,合格标准为去除后宿主 DNA 占比≤5%(肠道样本宿主 DNA 占比易偏高,需用专门去宿主工具如 Bowtie2、Kraken2 筛选)。
-
示例:人肠道样本去除前宿主 DNA 占比 68%,去除后降至 3.2%,满足分析要求。
-
序列组装质量评估图
-
核心用途:验证 contig/scaffold 的组装完整性和可靠性(组装质量直接影响后续分箱和注释)。
-
常用指标与图表:
-
N50 长度(Contig N50):箱线图展示各样本的 Contig N50 分布(N50≥1kb 为合格,≥5kb 为优质,越长说明组装越完整);
-
组装序列长度分布直方图:横轴为 Contig 长度,纵轴为序列数量,优质组装应呈现 “少量长 Contig + 大量中短 Contig”,无过多短片段(<200bp)。
-
示例:样本 Contig N50 中位数为 8.2kb,最长 Contig 达 50kb,组装质量良好。
(二)物种组成分析图(解析 “有哪些微生物”)
全面展示样本中微生物的物种分类及丰度分布,兼顾细菌、古菌、真菌、病毒等所有类群。
-
物种组成堆叠柱状图(门 / 属 / 种水平)
-
核心用途:展示不同样本在特定分类水平的物种丰度占比,直观对比分组间优势物种差异。
-
解读要点:
-
横轴为样本(按分组排列),纵轴为物种丰度占比(0-100%);
-
不同颜色代表不同物种(门 / 属 / 种),“Others” 归类低丰度物种(占比 < 1%);
-
重点关注:核心优势物种(如肠道样本中拟杆菌门、厚壁菌门)、分组特异性物种(如疾病组特有的致病菌)、稀有物种的分布。
-
示例:健康组肠道样本以拟杆菌门(42%)、厚壁菌门(38%)为优势门;疾病组中厚壁菌门降至 25%,变形菌门(含致病菌)升至 30%,提示菌群失调。
-
物种丰度热图(属 / 种水平)
-
核心用途:聚焦高丰度物种(如前 50 个属)或差异物种,展示其在不同样本中的丰度聚类模式。
-
解读要点:
-
横轴为样本(带分组聚类树),纵轴为物种(带物种进化树);
-
颜色深浅代表标准化后的丰度(红色 = 高丰度,蓝色 = 低丰度);
-
核心结果:样本聚类与分组一致(验证分组合理性),物种聚类可识别 “协同丰度变化的物种模块”(如 A 属与 B 属始终共丰度,可能存在互作关系)。
-
物种分布气泡图(属 / 种水平)
-
核心用途:展示 “样本 - 物种” 的丰度关联,适合多样本、多物种的可视化(比热图更适合展示低丰度物种)。
-
解读要点:
-
横轴为样本,纵轴为物种;
-
气泡大小代表物种丰度(越大丰度越高),气泡颜色代表分组;
-
优势:直观展示某一物种在不同样本中的丰度梯度(如 C 属在健康组样本中气泡大,疾病组气泡小,提示丰度显著下降)。
-
病毒 / 真菌特异性组成图(针对特殊研究目标)
-
核心用途:单独展示病毒、真菌等特定类群的组成(宏基因组可同时捕获这些类群,扩增子测序难以覆盖)。
-
示例:病毒组成堆叠图(按病毒科水平),显示健康组以温和噬菌体为主(占比 75%),疾病组烈性噬菌体占比升至 50%,提示噬菌体群落与疾病相关。
(三)多样性与群落差异分析图(解析 “微生物群落差异”)
与扩增子测序逻辑类似,但覆盖所有微生物类群,结果更全面。
-
α 多样性分析图(样本内多样性)
-
核心指标:Observed species(观测物种数)、Shannon 指数(丰富度 + 均匀度)、Simpson 指数(优势度)、Faith's PD(系统发育多样性)。
-
常用图表:箱线图 / 小提琴图(按分组展示指标分布)
-
解读要点:横轴为分组,纵轴为多样性指数;若两组间存在显著差异(ANOVA/Kruskal-Wallis 检验 P<0.05),说明样本内微生物丰富度或均匀度不同。
-
示例:健康组 Shannon 指数中位数为 7.8,疾病组为 5.2(P=0.003),提示疾病状态显著降低肠道微生物多样性。
-
β 多样性分析图(样本间多样性)
-
核心逻辑:基于物种组成矩阵(Bray-Curtis、Jaccard 距离)或功能基因矩阵,展示样本间群落差异。
-
常用图表:
(1)主坐标分析(PCoA 图)
-
解读要点:横轴(PC1)和纵轴(PC2)解释的差异比例越高,图表可靠性越强;同一分组样本聚集、不同分组分离,说明分组间群落结构差异显著(PERMANOVA 检验 P<0.05)。
-
示例:Bray-Curtis 距离 PCoA 图中,健康组与疾病组样本完全分离,PC1 解释 62.4% 差异(P=0.001),证明两组微生物群落结构极显著不同。
(2)非度量多维尺度分析(NMDS 图)
-
解读要点:应力值(Stress)<0.2 为合格,<0.1 为优秀;适合非正态分布的宏基因组数据,更稳健。
(四)宏基因组特有分析图(分箱与 MAGs 分析)
宏基因组的核心优势的之一是能组装微生物基因组(MAGs),以下图表聚焦 MAGs 质量和功能。
-
MAGs 质量评估散点图(CheckM 评估)
-
核心用途:展示组装的 MAGs 的 “完成度(Completeness)” 和 “污染率(Contamination)”,筛选高质量 MAGs。
-
解读要点:
-
横轴为完成度(越高越好,≥90% 为优质),纵轴为污染率(越低越好,≤5% 为优质);
-
每个点代表一个 MAG,颜色代表物种门水平分类;
-
筛选标准:完成度≥70%、污染率≤10%(合格),完成度≥90%、污染率≤5%(优质,可用于后续功能解析)。
-
示例:共组装获得 32 个 MAGs,其中 15 个为优质 MAGs(完成度 92%-98%,污染率 1.2%-3.8%),分属拟杆菌门、厚壁菌门等 6 个门。
-
MAGs 物种分类树(Phylogenetic Tree)
-
核心用途:展示高质量 MAGs 的系统发育地位,判断是否为新物种。
-
解读要点:
-
基于保守基因(如 16S rRNA、核糖体蛋白基因)构建进化树,结合已知参考基因组标注;
-
若某 MAG 与所有参考基因组的进化距离较远(形成独立分支),提示可能是未报道的新物种。
-
示例:MAG-08 与拟杆菌门已知物种的序列相似性仅 85%,形成独立分支,推测为新物种。
-
MAGs 功能基因富集热图
-
核心用途:比较不同 MAGs 携带的核心功能基因(如耐药基因、降解酶基因)的丰度差异。
-
解读要点:
-
横轴为 MAGs(按物种聚类),纵轴为功能基因(如 β- 内酰胺类耐药基因、纤维素降解酶基因);
-
颜色深浅代表基因拷贝数或丰度,可快速定位 “功能特异性 MAGs”(如 MAG-12 携带大量耐药基因,可能是耐药菌株)。
(五)功能解析分析图(解析 “微生物功能潜力”)
宏基因组的核心价值在于功能挖掘,以下图表聚焦基因功能、代谢通路的分布与差异。
-
功能基因分类柱状图 / 堆叠图(COG/KEGG Level 1/2)
-
核心用途:展示样本中功能基因在不同功能大类 / 亚类的丰度分布。
-
解读要点:
-
以 COG 为例:横轴为 COG 功能大类(如 J = 翻译、K = 转录、E = 氨基酸代谢、P = 无机离子转运),纵轴为基因丰度占比;
-
重点关注:分组间差异显著的功能类别(如疾病组 “防御机制(V 类)” 基因占比显著升高,提示耐药或应激功能增强)。
-
示例:土壤样本中,处理组(施加农药)的 “解毒功能(Q 类)” 基因占比从 5% 升至 12%,提示微生物群落通过增强解毒功能适应农药胁迫。
-
KEGG 代谢通路富集气泡图 / 网络图
-
核心用途:展示差异功能通路的富集情况,聚焦关键代谢通路(如碳代谢、氮循环、耐药通路)。
-
解读要点:
-
气泡图:横轴为富集倍数,纵轴为 KEGG 通路名称(如 “ABC 转运蛋白通路”“青霉素生物合成通路”),气泡大小 = 功能基因数量,颜色 = Padj 值(越红越显著);
-
通路网络图:节点代表通路,线条代表通路间的关联(如代谢物互通),可展示 “核心功能通路模块”(如肠道样本中 “糖代谢 - 氨基酸代谢” 通路模块在健康组更活跃)。
-
功能基因热图(核心功能基因集)
-
核心用途:聚焦特定功能基因集(如耐药基因 ARGs、碳水化合物活性酶 CAZy、毒力因子 VFDB),展示其在不同样本中的丰度差异。
-
解读要点:
-
横轴为样本,纵轴为目标功能基因(如不同类型的 ARGs);
-
颜色深浅代表基因丰度,可快速识别 “分组特异性功能基因”(如医院污水样本中 β- 内酰胺类 ARGs 丰度显著高于普通污水)。
-
CAZy 酶家族分布热图(针对碳代谢研究)
-
核心用途:展示碳水化合物活性酶(如糖苷水解酶 GH、糖基转移酶 GT、酯酶 CE)的家族分布,反映微生物降解碳水化合物的能力。
-
示例:堆肥样本中,高温阶段 GH 家族(如 GH1、GH3)丰度显著升高,提示微生物通过分泌纤维素降解酶加速有机物分解。
(六)差异比较分析图(解析 “分组间物种 / 功能差异”)
聚焦分组间的显著差异,验证实验假设。
-
差异物种火山图(属 / 种 / MAGs 水平)
-
核心用途:筛选分组间显著差异的物种(兼顾丰度倍数和统计显著性)。
-
解读要点:与扩增子测序火山图逻辑一致,横轴为 log2 (FC),纵轴为−log10 (Padj);红色 = 显著上调物种,蓝色 = 显著下调物种。
-
差异点:宏基因组可在种水平或 MAGs 水平筛选差异,分辨率更高(如筛选出疾病组特有的致病菌种 D,Padj=0.002)。
-
差异功能基因火山图
-
核心用途:筛选分组间显著差异的功能基因(如 ARGs、代谢酶基因)。
-
示例:共筛选出 48 个显著差异 ARGs,其中 32 个在耐药组上调(如 blaTEM 基因,FC=8.3),16 个下调,提示耐药组微生物携带更多耐药基因。
-
LEfSe 功能富集图(功能标志物筛选)
-
核心用途:筛选 “分组特异性功能标志物”(如某通路或基因集),适合多分组比较。
-
解读要点:左侧为 LDA 分值(≥2 为阈值),纵轴为功能类别 / 基因集;右侧为功能层级图,展示标志物的功能归属(如筛选出健康组特有的 “丁酸合成通路”,LDA=4.5,为核心功能标志物)。
三、核心总结
-
技术核心:宏基因组测序以 “无靶向、全基因组覆盖” 为特点,同时产出 “物种组成” 和 “功能信息”,适合深入解析微生物群落的机制性问题;
-
必做核心图:物种组成堆叠柱状图、α/β 多样性分析图、MAGs 质量评估图、KEGG 功能通路富集图、差异物种 / 功能火山图;
-
特有优势图:MAGs 系统发育树、MAGs 功能热图、功能基因集(ARGs/CAZy)热图、代谢通路网络图(区别于扩增子测序的核心图表);
-
分析逻辑:从 “数据质控→组装分箱→物种组成→MAGs 解析→功能注释→差异比较” 逐步深入,核心是 “物种与功能的关联分析”(如 “某差异物种是否携带核心功能基因?”);
-
工具推荐:组装(Megahit、Spades)、分箱(MetaBAT2、MaxBin2、VAMB)、质量评估(CheckM)、注释(Kraken2、Metaphlan4、eggNOG-mapper、KEGG GhostKOALA)、绘图(R ggplot2、Python seaborn、Cytoscape)。
这些图表覆盖了宏基因组测序从 “数据验证” 到 “机制解析” 的全流程,是科研论文和项目报告的核心展示载体,解读时需结合样本类型和实验假设,重点突出 “物种 - 功能 - 表型” 的关联(如 “某致病菌 MAG 携带毒力因子,与疾病表型相关”)。