全外显子测序(WES)介绍及核心生信分析图解读
全外显子测序(Whole Exome Sequencing, WES)是针对基因组中 外显子区域(约占全基因组 1%-2%,包含编码蛋白质的关键基因序列)进行的靶向高通量测序技术。其核心优势是 “精准聚焦编码区、测序深度高、成本低于全基因组测序(WGS)”,通过捕获并测序外显子区域,高效挖掘与疾病(如遗传病、肿瘤)、表型相关的 基因突变(SNV、InDel、CNV 等),广泛应用于医学遗传学诊断、肿瘤驱动基因筛选、药物靶点发现等领域。
一、全外显子测序核心基础
1. 技术原理与核心特点
(1)核心原理
-
样本制备:提取基因组 DNA(血液、组织、细胞等样本);
-
外显子捕获:使用商业化捕获探针(如 Agilent SureSelect、Illumina Nextera)特异性结合外显子区域 DNA 片段;
-
文库构建:洗脱捕获的外显子片段,构建测序文库(连接接头和 barcode);
-
高通量测序:Illumina NovaSeq/HiSeq 平台测序(通常为双端 150bp),获得高深度测序数据(目标区域平均深度≥100×,确保变异检出准确性);
-
生信分析:从原始数据过滤、比对、变异检测到注释、筛选、验证的全流程解析。
(2)核心优势与适用场景
-
优势:聚焦编码区(变异致病性强)、测序深度高(变异检出灵敏度高)、成本低(相比 WGS 更适合大规模样本);
-
适用场景:
-
遗传病:孟德尔遗传病(常染色体显性 / 隐性、性染色体连锁)的致病基因定位;
-
肿瘤:肿瘤组织 vs 正常组织的体细胞变异(驱动突变、拷贝数变异)筛选;
-
复杂疾病:复杂表型(如罕见病、慢性病)的易感基因关联分析。
2. 核心分析目标
-
变异检测:识别外显子区域的遗传变异(单核苷酸变异 SNV、小插入缺失 InDel、拷贝数变异 CNV、基因融合等);
-
变异注释:标注变异的位置(基因、外显子、密码子)、类型(同义突变、错义突变、无义突变等)、致病性预测(如 PolyPhen-2、SIFT 评分);
-
变异筛选:结合临床表型、家系信息(遗传病)或肿瘤特征(肿瘤研究),筛选潜在致病 / 驱动变异;
-
功能解读:分析变异对蛋白质结构、功能的影响,以及相关基因的通路富集,揭示变异的生物学意义。
二、全外显子测序核心生信分析图(按分析逻辑分类)
(一)数据质控与捕获效率分析图(验证数据可靠性)
用于评估测序数据质量、外显子捕获效果,确保变异检测的准确性。
-
测序数据质量分布图(FastQC/Trimmomatic 图)
-
核心用途:验证原始测序数据的碱基质量、接头污染、GC 含量。
-
解读要点:
-
碱基质量值:所有位置 Phred 质量值≥20(合格),≥30(优质),末端碱基质量无急剧下降(避免低质量碱基导致比对错误);
-
接头污染:Adapter 含量≤1%(超标需用 Cutadapt 去除);
-
GC 含量:无异常双峰(若出现双峰,提示探针捕获偏倚或样本污染)。
-
示例:Illumina 测序数据,150bp 读长质量值均≥30,接头污染率 0.3%,GC 含量分布正常(约 40%-45%),数据合格。
-
测序覆盖度分析图(Coverage Analysis)
-
核心用途:评估外显子区域的测序覆盖均匀性和深度,是变异检出的关键指标。
-
常用图表:
-
覆盖深度分布直方图:横轴为外显子区域的测序深度,纵轴为覆盖该深度的碱基比例;合格标准:≥80% 的目标区域深度≥20×,≥90% 的目标区域深度≥10×(深度过低会导致变异漏检);
-
平均覆盖深度箱线图:按样本展示外显子区域平均测序深度(通常≥100×),同一批样本深度差异应≤30%(避免批次偏倚);
-
覆盖均一性热图:展示不同样本在染色体水平的覆盖深度分布,无明显缺失或异常高覆盖区域(排除捕获失败或重复序列污染)。
-
示例:目标区域平均深度 128×,92% 的区域深度≥20×,覆盖均一性良好,满足变异检测要求。
-
外显子捕获效率图
-
核心用途:验证探针对目标外显子区域的捕获特异性。
-
常用图表:
-
捕获区域分布饼图:展示 “目标外显子区域 reads 占比”“非目标区域(内含子、基因间区)reads 占比”“未比对 reads 占比”;合格标准:目标区域 reads 占比≥80%(捕获特异性高);
-
染色体捕获覆盖图:横轴为染色体编号,纵轴为目标区域覆盖比例,所有染色体的目标区域覆盖比例≥95%(避免特定染色体外显子捕获失败)。
-
示例:目标外显子区域 reads 占比 86%,所有染色体外显子覆盖比例≥97%,捕获效率优秀。
(二)变异检测与分布分析图(解析 “变异在哪里”)
核心是展示检测到的变异类型、数量、基因组分布特征,为后续筛选提供基础。
-
变异类型统计柱状图 / 饼图
-
核心用途:统计检测到的变异类型及数量(SNV、InDel、CNV 等)。
-
解读要点:
-
按变异类型分类:SNV(单核苷酸变异,如 A→G)、InDel(小插入缺失,长度≤50bp)、CNV(拷贝数变异,如基因扩增、缺失);
-
按变异影响分类(针对 SNV/InDel):同义突变(不改变氨基酸)、错义突变(改变氨基酸)、无义突变(提前终止密码子)、移码突变(导致阅读框改变)、剪接位点突变(影响 RNA 剪接);
-
典型特征:遗传病样本中,致病性变异多为错义突变、无义突变、移码突变;肿瘤样本中,体细胞变异以 SNV 和小 InDel 为主,部分存在 CNV 扩增 / 缺失。
-
示例:某遗传病家系样本共检测到 1246 个 SNV,其中错义突变 328 个、无义突变 16 个、移码突变 23 个,为后续致病性筛选聚焦重点。
-
变异在基因组 / 基因上的分布热图 / 点阵图
-
核心用途:展示变异在染色体、基因或外显子上的分布规律。
-
解读要点:
-
染色体分布点阵图:横轴为染色体编号及长度,纵轴为变异密度(每 1Mb 变异数),每个点代表一个变异;重点关注 “变异富集区域”(如肿瘤样本中某染色体片段变异密度显著升高,可能为驱动突变区域);
-
基因水平热图:横轴为样本,纵轴为候选基因,颜色代表基因内变异数量 / 类型(如红色 = 错义突变,蓝色 = 无义突变);快速定位 “高频变异基因”(如肿瘤样本中 TP53、EGFR 基因变异频率高,可能为驱动基因)。
-
示例:肿瘤样本中,7 号染色体短臂(EGFR 基因所在区域)变异密度显著升高,EGFR 基因在 60% 的样本中存在错义突变,提示其可能为核心驱动基因。
-
InDel 长度分布直方图
-
核心用途:验证小插入缺失的长度分布合理性(避免假阳性变异)。
-
解读要点:
-
横轴为 InDel 长度(bp,插入为正,缺失为负),纵轴为 InDel 数量;
-
典型特征:InDel 长度以 1-3bp 为主(符合 DNA 复制错误或修复异常的特征),长片段 InDel(>10bp)数量极少(若过多,提示可能存在假阳性);
-
示例:90% 的 InDel 长度为 1-3bp,最长 InDel 为 8bp,分布符合预期,变异可靠性高。
(三)变异注释与致病性分析图(筛选 “潜在致病 / 驱动变异”)
核心是通过注释和预测,从海量变异中筛选出具有生物学意义的关键变异。
-
变异致病性预测结果图(气泡图 / 散点图)
-
核心用途:整合多个致病性预测工具(PolyPhen-2、SIFT、CADD、REVEL 等),评估变异的致病性。
-
解读要点:
-
散点图(以 PolyPhen-2 vs SIFT 为例):横轴为 PolyPhen-2 评分(0-1,越高致病性越强),纵轴为 SIFT 评分(0-1,越低致病性越强);右上角(PolyPhen-2≥0.9,SIFT≤0.05)为高致病性变异;
-
气泡图(整合多工具):横轴为 CADD 评分(≥15 为有害,≥20 为高有害),纵轴为 REVEL 评分(≥0.5 为致病性),气泡大小代表变异在人群中的频率(gnomAD 数据库频率,越小越可能致病);筛选标准:CADD≥20、REVEL≥0.5、gnomAD 频率≤0.001(1‰)的变异。
-
示例:筛选出 3 个高致病性变异(均为错义突变),其中变异 c.1234G>A(基因 X)的 CADD=28.5、REVEL=0.72、人群频率 = 0.0003,为重点候选变异。
-
变异在人群数据库中的频率分布图
-
核心用途:排除常见多态性变异(人群中频率高,致病性低),聚焦稀有变异。
-
常用图表:
-
频率分布直方图:横轴为变异的人群频率(gnomAD、ExAC 数据库),纵轴为变异数量;遗传病研究中,候选变异的人群频率通常≤0.001(1‰),肿瘤体细胞变异频率无严格限制(但驱动突变频率可能较高);
-
曼哈顿图(人群关联分析):横轴为染色体位置,纵轴为−log10 (P 值),展示变异与表型的关联强度;显著关联的变异(P<5e-8)为候选易感变异。
-
示例:某遗传病样本中,候选变异 c.567delT(基因 Y)的人群频率为 0.0001(1/10000),符合稀有变异特征,排除常见多态性。
-
家系共分离分析图(遗传病特有)
-
核心用途:验证候选变异是否与家系中的疾病表型共分离(患病个体均携带变异,正常个体不携带)。
-
解读要点:
-
家系图 + 变异携带状态:圆形 = 女性,方形 = 男性,黑色 = 患病,白色 = 正常;每个个体标注是否携带候选变异(+/- 表示杂合子,+/+ 表示纯合子,-/- 表示野生型);
-
共分离标准:所有患病个体均携带变异,正常个体(非携带者)不患病;若为常染色体显性遗传,患病个体多为杂合子;常染色体隐性遗传,患病个体多为纯合子或复合杂合子。
-
示例:某常染色体隐性遗传病家系中,2 名患病子女均为变异 c.345A>T(基因 Z)的纯合子(-/-),父母均为杂合子(+/-),符合共分离规律,该变异为致病候选变异。
-
肿瘤体细胞变异瀑布图(Oncoplot,肿瘤特有)
-
核心用途:展示多个肿瘤样本中高频驱动基因的体细胞变异分布(SNV、InDel、CNV)。
-
解读要点:
-
横轴为肿瘤样本(按突变负荷排序),纵轴为候选驱动基因(按变异频率排序);
-
颜色编码:不同颜色代表不同变异类型(如红色 = 错义突变,蓝色 = 无义突变,绿色 = 扩增,灰色 = 缺失);
-
右侧条形图:展示每个基因的变异频率(越高越可能为驱动基因);
-
顶部条形图:展示每个样本的总变异负荷(TMB,肿瘤突变负荷);
-
示例:TP53(变异频率 45%)、EGFR(38%)、KRAS(32%)为 TOP3 驱动基因,其中 TP53 以错义突变为主,EGFR 存在扩增和错义突变,提示这些基因为肿瘤发生发展的核心。
(四)变异功能解读分析图(解析 “变异的生物学意义”)
核心是分析关键变异对基因、蛋白质、通路的影响,揭示变异与表型的关联机制。
-
基因结构与变异位置示意图
-
核心用途:展示候选变异在基因结构中的具体位置(外显子、内含子、剪接位点),以及对蛋白质结构的影响。
-
解读要点:
-
基因结构:矩形代表外显子(编码区),线条代表内含子,箭头代表转录方向;
-
变异标注:在对应外显子 / 位点标注变异(如 c.1234G>A,p.Arg412His),并标注变异类型(错义突变、无义突变等);
-
蛋白质结构:结合蛋白质结构域(如激酶结构域、结合结构域),标注变异是否位于功能结构域内(位于功能结构域内的变异更可能影响蛋白质功能)。
-
示例:变异 c.789T>C(基因 X)位于其蛋白质的 ATP 结合结构域内,导致氨基酸替换(p.Phe263Leu),可能影响蛋白质的 ATP 结合能力,进而影响功能。
-
蛋白质结构预测图(PyMOL/AlphaFold 可视化)
-
核心用途:直观展示变异对蛋白质三维结构的影响(如空间构象改变、结合位点破坏)。
-
解读要点:
-
野生型 vs 突变型蛋白质结构对比:红色标注变异位点,展示变异前后氨基酸侧链的空间位置变化;
-
关键判断:变异是否导致蛋白质结构域折叠异常、活性中心破坏、配体结合位点改变(如酶活性中心的变异可能导致酶功能丧失)。
-
示例:错义突变 p.Arg325Cys 导致蛋白质活性中心的氢键网络破坏,空间构象发生显著变化,推测该变异导致蛋白质功能失活。
-
候选基因 GO/KEGG 通路富集分析图(气泡图 / 柱状图)
-
核心用途:分析关键变异所在基因的功能富集,揭示其参与的生物学通路。
-
解读要点:
-
气泡图:横轴为富集倍数,纵轴为 GO 术语 / KEGG 通路名称,气泡大小 = 基因数量,颜色 = Padj 值(越红越显著);
-
遗传病研究:候选基因富集在与疾病表型相关的通路(如神经退行性疾病候选基因富集在 “神经突触传递” 通路);
-
肿瘤研究:驱动基因富集在 “细胞周期调控”“DNA 损伤修复”“信号转导” 等通路(如 EGFR、KRAS 富集在 “MAPK 信号通路”)。
-
示例:某罕见病候选基因显著富集在 “胆固醇代谢通路”(Padj=0.002),与患者 “高胆固醇血症” 表型一致,提示该通路异常为疾病致病机制。
-
拷贝数变异(CNV)分析图(肿瘤 / 遗传病特有)
-
核心用途:检测外显子区域的基因拷贝数变化(扩增 / 缺失),评估其对基因表达的影响。
-
常用图表:
-
染色体水平 CNV 分布图:横轴为染色体位置,纵轴为拷贝数比值(肿瘤 / 正常或病例 / 对照);比值 > 2 为扩增,<0.5 为缺失;
-
基因水平 CNV 热图:横轴为样本,纵轴为基因,颜色代表拷贝数(红色 = 扩增,蓝色 = 缺失);
-
示例:肿瘤样本中 EGFR 基因拷贝数比值 = 3.8(扩增),MYC 基因拷贝数比值 = 4.2(扩增),提示这些基因可能通过拷贝数扩增驱动肿瘤增殖。
(五)变异验证与关联分析图(验证变异可靠性)
用于验证候选变异的真实性,以及与表型 / 临床特征的关联。
-
Sanger 测序验证图(Chromatogram)
-
核心用途:金标准验证 WES 检测到的候选变异(排除假阳性)。
-
解读要点:
-
测序峰图:横轴为碱基位置,纵轴为峰高(信号强度);野生型样本为单一峰(如 A 峰),杂合子变异样本为双峰(如 A/G 峰),纯合子变异样本为单一峰(如 G 峰);
-
验证标准:Sanger 测序结果与 WES 检测结果完全一致,变异位点峰型清晰无杂峰。
-
示例:Sanger 测序验证变异 c.1234G>A,患者样本为杂合子(G/A 双峰),正常对照为野生型(G 单峰),验证该变异真实存在。
-
变异与临床特征关联散点图(肿瘤 / 复杂疾病)
-
核心用途:分析候选变异与临床特征(如肿瘤分期、预后、药物响应)的关联。
-
解读要点:
-
横轴为临床特征(如肿瘤患者生存期),纵轴为变异状态(有 / 无变异);
-
关键判断:携带变异的患者是否与无变异患者存在显著临床差异(如携带 EGFR 突变的肺癌患者对靶向药物响应率更高,生存期更长)。
-
示例:携带 KRAS 突变的结直肠癌患者,无病生存期(DFS)显著短于无 KRAS 突变患者(P=0.02),提示 KRAS 突变为不良预后标志物。
三、核心总结
-
技术核心:WES 聚焦外显子编码区,以 “高深度、高特异性” 高效检测致病性变异,是遗传病和肿瘤研究的核心技术;
-
必做核心图:测序覆盖度分析图、变异类型统计饼图、变异致病性预测散点图、基因结构与变异位置图、Sanger 验证峰图;
-
特有优势图:家系共分离分析图(遗传病)、肿瘤体细胞变异瀑布图(肿瘤)、蛋白质结构预测图、CNV 分布图;
-
分析逻辑:从 “数据质控→变异检测→注释筛选→功能解读→验证关联” 逐步深入,核心是 “变异的真实性验证” 和 “与表型的关联性解读”;
-
工具推荐:数据比对(BWA、Bowtie2)、变异检测(GATK、Mutect2(肿瘤)、VarScan2)、注释(Annovar、VEP)、可视化(IGV、R ggplot2、Oncoplotter、PyMOL)。
这些图表覆盖了 WES 从 “数据验证” 到 “机制解析” 的全流程,是科研论文和临床诊断报告的核心展示载体,解读时需结合样本类型(遗传病 / 肿瘤)、实验设计(家系 / 病例对照)和临床表型,重点突出 “变异 - 基因 - 功能 - 表型” 的逻辑链。