真核/原核转录组测序
所有栏目

真核与原核转录组介绍及核心生信分析图

转录组(Transcriptome)是指特定生物 / 细胞在特定时空条件下,基因组中所有转录产物(mRNA、非编码 RNA 等,核心分析对象多为 mRNA)的集合,其研究核心是揭示基因表达的 “差异” 与 “调控机制”。真核生物与原核生物因基因组结构、转录机制的本质差异,转录组特征和分析重点存在显著区别,以下结合核心特征和生信分析图表展开说明:

一、真核生物与原核生物转录组核心差异

对比维度 真核生物转录组 原核生物转录组
基因组基础 基因组大(数 Gb),含内含子、重复序列,染色体线性 基因组小(数百万 bp),无内含子,基因连续排列,染色体环状
转录单元 单顺反子为主(一个基因转录生成一条 mRNA,编码一个蛋白) 多顺反子为主(一个操纵子转录生成一条 mRNA,编码多个功能相关蛋白)
转录后加工 需复杂加工:5' 端加帽、3' 端加尾(polyA)、剪接(去除内含子) 无加工过程,转录与翻译同步进行(边转录边翻译)
核心 RNA 类型 mRNA(带 polyA 尾,易富集)、lncRNA、miRNA 等非编码 RNA 丰富 mRNA(无 polyA 尾,需通过 rRNA 去除法富集),非编码 RNA 种类少
技术适配性 常规 RNA-seq(polyA 富集法)为主,需考虑剪接异构体 需专用建库方案(如 rRNA depletion),关注操纵子表达协同性
分析核心重点 差异表达基因(DEG)、可变剪接、非编码 RNA 调控、基因共表达网络 差异表达操纵子、功能通路富集、转录单元结构(启动子 - 基因关联)、代谢通路重构

二、转录组核心生信分析图(按分析流程分类)

转录组分析的核心逻辑是 “数据质控→表达定量→差异筛选→功能解读”,每个环节对应特征性图表,以下为高频使用且解读性强的图表:

(一)数据质控与样本可靠性分析图

用于验证测序数据质量和样本分组的合理性,是后续分析的基础。
  1. FastQC 质控图(碱基质量分布图)
    • 核心用途:评估测序数据的可靠性(避免低质量碱基影响分析)。
    • 解读要点:横轴为测序读长(碱基位置),纵轴为 Phred 质量值(≥20 为合格,≥30 为优质),合格样本的质量值需整体在 20 以上,无明显下降趋势。
    • 适用场景:真核、原核转录组通用(所有 RNA-seq 第一步必做)。
  2. 主成分分析(PCA)图
    • 核心用途:展示样本间的整体差异,验证分组是否合理(生物学重复是否聚集)。
    • 解读要点:横轴(PC1)和纵轴(PC2)分别代表最大、次大差异维度,同一分组的样本应聚集在一起,不同分组的样本应明显分离(分离程度反映差异大小)。
    • 适用场景:真核、原核通用(若样本聚集混乱,需排查实验设计或技术误差)。
  3. 样本相关性热图(Sample Correlation Heatmap)
    • 核心用途:量化样本间的基因表达模式相似性(数值越接近 1,相似性越高)。
    • 解读要点:颜色越深(如红色)代表相关性越高,生物学重复样本的相关性应显著高于不同处理组(如 “对照组” 与 “处理组” 的相关性低于组内重复)。
    • 适用场景:真核、原核通用(验证重复样本的一致性)。

(二)基因表达定量与分布分析图

用于展示基因表达的整体特征(如表达量范围、分布规律)。
  1. 基因表达量箱线图(Boxplot of Gene Expression)
    • 核心用途:比较不同样本的基因表达量分布(消除测序深度差异后的标准化结果)。
    • 解读要点:横轴为样本名称,纵轴为标准化后的表达量(如 log2 (FPKM/TPM)),箱线图的中位数越接近,说明样本间表达量分布越一致(避免测序偏差)。
    • 适用场景:真核、原核通用(FPKM 适用于单顺反子,TPM 更适合多样本 / 多顺反子比较)。
  2. 基因表达量密度图 / 直方图
    • 核心用途:展示所有基因的表达量分布特征(如高表达、低表达基因的比例)。
    • 解读要点:横轴为表达量(log10 (FPKM+1)),纵轴为基因密度,真核生物因存在大量低表达非编码 RNA,通常呈现 “双峰或右偏分布”;原核生物基因表达更集中,分布相对单一。
    • 差异点:原核生物无内含子和大量非编码 RNA,高表达基因比例更高(多为功能核心基因)。
  3. rRNA 去除效率验证图(原核特有)
    • 核心用途:验证原核转录组建库中 rRNA 的去除效果(rRNA 占比过高会影响 mRNA 检测)。
    • 解读要点:通过饼图或柱状图展示 rRNA、mRNA、tRNA 等 RNA 类型的占比,合格样本的 rRNA 占比需≤30%(原核生物 rRNA 天然占比高,需通过专用试剂盒去除)。

(三)差异表达分析核心图

转录组的核心结果图,直接展示 “处理组 vs 对照组” 的差异基因 / 操纵子。
  1. 火山图(Volcano Plot)
    • 核心用途:直观展示差异基因的数量和显著程度(兼顾 “倍数变化” 和 “统计显著性”)。
    • 解读要点:横轴为 log2 (差异倍数,FC),纵轴为−log10 (P 值 / Padj 值);右上角(FC≥2、Padj<0.05)为显著上调基因(红色),左上角为显著下调基因(蓝色),中间为无差异基因(灰色)。
    • 适用场景:真核(差异基因)、原核(差异基因 / 操纵子)通用,是文章必放核心图。
  2. 差异基因聚类热图(Heatmap of DEGs)
    • 核心用途:展示差异基因在不同样本中的表达模式聚类(相同表达趋势的基因聚为一类)。
    • 解读要点:横轴为样本,纵轴为差异基因,颜色代表表达量(红色 = 高表达,蓝色 = 低表达);可清晰区分 “处理组特异性高表达”“对照组特异性高表达” 等模块,为功能富集提供方向。
    • 差异点:原核生物可替换为 “差异操纵子聚类热图”,关注操纵子内基因的协同表达。
  3. 差异基因火山图补充(MA 图)
    • 核心用途:弥补火山图对低表达差异基因的展示不足,聚焦 “表达量水平” 与 “差异倍数” 的关系。
    • 解读要点:横轴为 log2 (平均表达量),纵轴为 log2 (FC);显著差异基因标注为红色,可观察低表达基因是否存在假阳性差异。

(四)功能富集与机制解读分析图

用于解释差异基因的生物学意义(避免 “只懂差异,不懂功能”)。
  1. GO 富集分析气泡图 / 柱状图
    • 核心用途:展示差异基因显著富集的 GO 术语(生物学过程 BP、细胞组分 CC、分子功能 MF)。
    • 解读要点:
      • 气泡图:横轴为富集倍数,纵轴为 GO 术语,气泡大小代表差异基因数量,颜色代表 Padj 值(越红越显著);
      • 柱状图:横轴为富集倍数,纵轴为 GO 术语,高度代表富集程度。
    • 适用场景:真核生物为主(原核生物 GO 注释相对不完整,可结合 COG/eggNOG 分析)。
  2. KEGG 通路富集分析图(气泡图 / 通路图)
    • 核心用途:展示差异基因参与的显著代谢通路 / 信号通路(如 “糖代谢”“抗生素合成通路”)。
    • 解读要点:
      • 气泡图:与 GO 气泡图逻辑一致,聚焦通路层面的富集;
      • 通路图:在 KEGG 原始通路图上标注差异基因(红色 = 上调,蓝色 = 下调),直观展示通路中关键基因的变化。
    • 适用场景:真核、原核通用(原核常用 “代谢通路”“抗生素合成”“ABC 转运蛋白” 等通路)。
  3. COG/eggNOG 功能分类图(原核特有)
    • 核心用途:对原核差异基因进行功能分类(弥补 GO 注释不足)。
    • 解读要点:以柱状图展示差异基因在不同 COG 类别中的分布(如 J = 翻译、K = 转录、E = 氨基酸代谢),快速定位核心功能模块(如抗生素处理后,“抗生素耐药” 相关 COG 类别基因富集)。
  4. 非编码 RNA 调控网络图(真核特有)
    • 核心用途:展示真核生物中 lncRNA/miRNA 与 mRNA 的调控关系(如 miRNA 靶向调控差异 mRNA)。
    • 解读要点:以节点代表 RNA(圆形 = mRNA,三角形 = miRNA),线条代表调控关系,可筛选核心调控因子(如与多个差异 mRNA 关联的 miRNA)。
  5. 操纵子结构与表达关联图(原核特有)
    • 核心用途:展示原核生物中操纵子的组成及差异表达情况。
    • 解读要点:以基因组位置为横轴,展示操纵子内各基因的位置的表达量(如处理组 vs 对照组的表达量变化),验证操纵子的协同表达(如操纵子内所有基因均上调 / 下调)。

三、总结

  1. 核心差异:真核转录组关注 “剪接、非编码 RNA、复杂调控网络”,原核转录组关注 “操纵子、代谢通路、转录 - 翻译同步性”;
  2. 通用核心图:PCA 图、火山图、差异基因聚类热图、KEGG 富集气泡图(所有转录组必做);
  3. 特有图:真核需加 GO 富集图、非编码 RNA 调控图;原核需加 rRNA 去除效率图、COG 分类图、操纵子表达图。