蛋白质组学分析②:从静态到动态!用桑基图& GSEA & Mfuzz & PPI 深挖数据深层机制
所属分类: 技术干货
发布时间: 2025-11-20
概要: 本文将详细拆解桑基图、GSEA 图、Mfuzz 时序聚类图、PPI 网络图的核心信息,帮你从 “静态描述” 升级为 “动态机制挖掘”。
Day1 我们通过火山图、GO/KEGG 富集气泡图解决了 “找差异、定功能” 的基础问题,但组学数据中 “基因的多对多归属”“整体表达趋势”“蛋白互作网络” 等复杂信息,需要更精准的可视化工具解读。本文将详细拆解桑基图、GSEA 图、Mfuzz 时序聚类图、PPI 网络图的核心信息,帮你从 “静态描述” 升级为 “动态机制挖掘”。
一、桑基图(Sankey Diagram):基因多维度关系的 “可视化纽带”
当数据存在 “多对多关联”(如一个基因属于多个 GO 条目、样本聚类结果跨多个分类)时,桑基图能清晰展示 “元素的流动与归属关系”,避免传统表格的信息混乱。
1.展示形式
桑基图是流程示意图,核心由 “节点” 与 “连接箭头” 构成:

节点:
按“分类维度”水平排列(通常 3-4 层),代表不同的分类或层级(如第一层 “样本组”、第二层 “差异基因聚类簇”、第三层 “GO 条目”、第四层 “KEGG 通路”),节点大小可反映该分类包含的元素数量(如聚类簇节点大,说明该簇基因数多);
连接箭头(流):
连接不同层级的节点,箭头宽度与 “流经的元素数量” 成正比(如基因数量、样本数量),箭头颜色通常继承起始节点颜色(便于追溯来源,如处理组节点为红色,其流出的箭头均为红色)。
2.分析目的
用于可视化复杂的数据流动或层次关系,在生信分析中主要解决 “多维度归属” 问题:比如展示 “样本组 → 差异基因簇 → GO 条目 → KEGG 通路” 的基因流动,或“一个基因同时属于多个 GO 条目 / 通路”的多对多关系,帮助研究者直观理解各分类之间的比例与转移关联。
3.解读方法
解读核心是 “关注箭头宽度与节点关联”,步骤如下:
箭头宽度反映数量:
箭头越宽,流经的元素(如基因)数量越多,该 “归属路径” 越重要 —— 例如 “处理组→簇 3→GO‘细胞周期’→KEGG‘hsa04110’” 的箭头最宽,说明该路径上的基因数量最多,是核心关联路径;
节点连接反映归属:
若某 GO 条目节点连接多个聚类簇节点,说明该 GO 功能是 “多聚类簇共有的核心功能”;若某基因簇节点连接多个通路节点,说明该簇基因参与 “多通路调控”;
层次结构揭示逻辑:
从左至右的层级顺序(如样本→基因→功能→通路),可清晰追溯 “元素从源头到终端的归属逻辑”,例如从 “对照组” 流出的箭头多指向 “基础代谢通路”,从 “处理组” 流出的箭头多指向 “应激响应通路”,可直接关联处理因素的调控效应。
4.常用工具
编程工具:
Python(plotly或matplotlib)、R(networkD3或ggalluvial包),支持自定义节点颜色、箭头宽度与层级;
在线工具:
SankeyMATIC、RawGraphs,无需编程,上传 “源头 - 目标 - 数量” 格式数据即可生成交互式桑基图;
二、基因集富集分析图(GSEA Plot):基因集整体趋势的 “探测器”
传统富集分析仅关注 “显著差异基因”,而 GSEA 图聚焦 “预先定义的基因集(如通路基因集、功能基因集)在全基因排序列表中的整体富集趋势”,能捕捉 “细微但一致” 的表达变化。
1.展示形式
GSEA 图是折线图,核心元素围绕 “基因排序” 与 “富集分数” 展开:

横轴:
基因在 “排序列表” 中的位置,列表通常按 “基因表达变化幅度” 排序(从左到右:最下调→最上调),横轴上的竖线代表 “该基因集中的基因” 在排序列表中的位置;
纵轴:
富集分数(Enrichment Score, ES),反映 “基因集中的基因在排序列表中是否集中分布在某一端”—— ES 为正,说明基因集中在 “上调端”;ES 为负,集中在 “下调端”;
关键辅助线:
一条水平参考线(如 ES 阈值),一条 “运行富集分数曲线” —— 随着从左到右遍历基因列表,每遇到一个基因集中的基因,ES 增加,遇到非该基因集的基因,ES 减少,曲线峰值即为 “最大富集程度”。
2.分析目的
用于展示基因集富集分析(GSEA)结果,判断 “预先定义的基因集” 在排序后的全基因列表中是否 “显著富集”。与传统富集分析相比,GSEA 无需设定差异基因阈值,能发现“无显著差异但整体趋势一致” 的基因集(如某通路基因均轻微上调),适合挖掘 “细微调控机制”。
3.解读方法
解读需围绕 “富集分数曲线趋势” 与 “显著性指标”:
曲线趋势判断富集方向:
● 曲线从左到右上升(ES 由负变正,峰值在右侧)→ 基因集富集在 “上调端”(如 “细胞增殖” 基因集在肿瘤组织中);
● 曲线从左到右下降(ES 由正变负,峰值在左侧)→ 基因集富集在 “下调端”(如 “细胞凋亡” 基因集在肿瘤组织中);
● 曲线无明显峰值、波动大→ 基因集无显著富集趋势;
阈值线判断显著性:
若曲线超过水平参考线(ES 阈值)且持续一定距离,说明基因集富集显著;
显著性指标验证:
图中通常标注 “名义 p 值” 与 “FDR q 值”,需同时满足 “p < 0.05” 与 “FDR q < 0.25”,富集结果才可靠。
4.常用工具
专用软件:
Gene Set Enrichment Analysis (GSEA) 桌面版,为每个测试的基因集自动输出 GSEA 图,支持批量分析;
在线工具:
GSEA-Preranked、Enrichr,支持上传排序后的基因列表,生成富集图;
编程工具:
R 语言fgsea包,可批量进行 GSEA 分析并绘制富集图,广泛应用于研究论文中。
三、Mfuzz 时序聚类图(Mfuzz Cluster Plot):时序表达的 “模式挖掘机”
当研究涉及“多时间点”(如 0h、6h、12h、24h)或“多处理条件”时,Mfuzz 时序聚类图能将 “动态表达的基因” 按 “模式相似性” 分组,挖掘 “协同调控的基因模块”。
1.展示形式
Mfuzz 聚类图是折线图,聚焦 “基因表达的时间 / 条件动态变化”:

横轴:
时间点或处理条件(如 0h→6h→12h→24h,低剂量→中剂量→高剂量),按逻辑顺序排列;
纵轴:
标准化的表达水平(通常为 Z-score),使不同基因的表达量可直接比较(Z-score 为正表示 “高于该基因的平均表达量”,为负表示 “低于平均”);
核心元素:
每个基因用一条细线表示,具有相似表达模式的基因被聚为一簇,用同一颜色标注;图中会绘制 “簇的平均表达趋势线”(通常为粗黑线),部分图会标注 “聚类成员值”(0-1,值越接近 1,基因属于该簇的确定性越高)。
2.分析目的
用于可视化时序基因表达数据的聚类结果。Mfuzz 基于 “模糊聚类算法”,允许基因 “部分属于多个簇”(更符合生物调控的复杂性),核心目的是发现 “具有相似动态表达模式的基因组”,进而揭示 “协同调控的基因模块”——例如疾病发展中 “持续高表达的炎症基因模块”、药物处理后 “先升后降的代谢基因模块”。
解读核心是 “簇的平均趋势线” 与 “聚类可靠性”:
平均趋势线看模式:
忽略单个基因的噪音,聚焦粗黑线(平均趋势)—— 例如某簇平均趋势线 “0h 低表达→6h 上调→12h 达峰→24h 下降”,说明该簇基因是 “短期响应基因”;另一簇 “全程持续下调”,说明是 “被抑制的基础功能基因”;
成员值看可靠性:
优先关注 “平均成员值> 0.7” 的簇,值越接近 1,簇内基因的表达模式越一致,结果越可靠;
簇与功能关联:
对每个可靠簇进行 GO/KEGG 富集分析,例如 “持续高表达簇” 富集 “免疫反应”,提示该模块与免疫激活相关;“先升后降簇” 富集 “信号传导”,提示该模块参与早期信号调控。
R 语言:
Mfuzz包,专用於时序模糊聚类,通过plotCluster函数绘制聚类图,支持自定义簇数与颜色;
Python:
scikit-learn的时间序列聚类方法,结合matplotlib可视化;
在线工具:
ClusterVis、Broad Institute 的 Morpheus,支持上传时序表达矩阵,生成交互式聚类图,广泛应用于发育生物学等领域。
四、蛋白互作网络图(PPI Network Plot):蛋白互作的 “关系图谱”
PPI 网络图将 “基因 / 蛋白” 与 “互作关系” 转化为 “节点 - 边” 结构,帮助研究者从“单个基因” 上升到 “网络层面”,识别 “核心枢纽蛋白” 与 “功能模块”。
1.展示形式
PPI 网络图是图结构,采用“力导向布局”(减少边的交叉,使网络更清晰):

节点:
代表蛋白质或其编码基因,节点属性包含 “大小” 与 “颜色”—— 大小与 “度中心性” 成正比(度中心性 = 节点连接的边数,越大说明蛋白互作伙伴越多,是 “枢纽蛋白”);颜色通常反映 “基因属性”(如显著上调用红色、显著下调用蓝色,或按功能类别着色,如凋亡相关用红色);
边:
代表蛋白质 - 蛋白质相互作用,边的粗细与 “互作置信度” 成正比(如 STRING 数据库中置信度 > 0.7 为粗边,可靠性高;<0.4 为细边,可过滤),部分图用颜色区分互作类型(如物理结合用黑色、共表达用灰色)。
2.分析目的
用于展示蛋白质相互作用网络,核心目的是:
识别 “枢纽蛋白”:
互作伙伴多的节点(大度中心性),通常是 “调控网络的核心”;
挖掘 “功能模块”:
网络中 “紧密连接的子图”(如 5-10 个节点形成的簇),通常对应 “蛋白复合物” 或 “通路核心组件”;
关联差异基因与网络:
将差异基因映射到网络中,看其是否位于 “枢纽位置” 或 “功能模块”,判断其调控重要性。
解读需按 “筛选可靠互作→找枢纽→析模块” 的步骤进行:
筛选可靠互作:
先过滤低置信度边(如置信度 < 0.7),避免假阳性干扰,保留的粗边才是可靠互作;
识别枢纽蛋白:
优先关注 “节点大(高度中心性)且颜色显著(差异基因)” 的蛋白 —— 例如某节点红色、大小最大、连接 15 条边,说明该蛋白是 “差异基因中的核心枢纽”,极可能是关键调控因子;
分析功能模块:
通过 “模块分析工具”(如 Cytoscape 的 MCODE 插件)识别紧密子图,对每个模块做 GO/KEGG 富集 —— 例如某模块富集 “细胞周期”,且包含 CDK2、Cyclin D1 等节点,说明是 “细胞周期调控模块”。
4.常用工具
数据库与软件:
STRING 数据库(输入基因列表,检索并构建互作网络)、Cytoscape(开源分子网络可视化平台,支持布局调整、模块分析与插件扩展);
编程工具:
Python(networkx、igraph库)、R(STRINGdb包);
应用场景:
蛋白质网络分析、药物靶点研究,广泛出现在研究论文中。
五、两天内容总结:生信可视化的完整逻辑链
通过两天的内容,我们覆盖了指南中 7 类核心生信分析图,构成了组学数据分析的完整可视化逻辑:
● 基础层(Day1):火山图(筛差异)→ GO/KEGG 气泡图(定功能 / 通路),解决 “找什么、做什么”;
● 深层(Day2):桑基图(展归属)→ GSEA 图(析趋势)→ Mfuzz 图(挖动态)→ PPI 图(建网络),解决 “怎么关联、怎么调控”。
掌握这些图表的 “形式 - 目的 - 解读 - 工具”,就能从海量组学数据中提炼出精准的生物学信息,为论文撰写与机制研究提供有力支撑。关注丸子,解锁更多科研干货~
往期回顾:
蛋白质组学分析①:入门必看!火山图 + GO/KEGG 气泡图搭建生信分析基础框架
推荐
谱度众合:二十年质谱技术沉淀助力于您的蛋白质研究
谱度众合是一家由武汉大学博士团队创办的科研服务企业,我们专注于利用质谱技术服务于生物标志物、药物靶点筛选、基础研究等蛋白质研究领域,我们在本专业细分领域持续深耕十几年,针对具体研究场景开发多种面向具体研究目的和论文发表需求的服务产品,助力于客户更轻松更高效的完成科研目标。

联系丸子,了解更多~
参考文献
[1] Biomedical Knowledge Mining using GOSemSim and clusterProfiler. Introduction | Biomedical Knowledge Mining using GOSemSim and clusterProfiler
[2] Subramanian A, Tamayo P, Mootha VK, et al. Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles. Proc Natl Acad Sci U S A. 2005;102(43):15545-15550. doi:10.1073/pnas.0506580102
[3] Szklarczyk D, Kirsch R, Koutrouli M, et al. The STRING database in 2023: protein-protein association networks and functional enrichment analyses for any sequenced genome of interest. Nucleic Acids Res. 2023;51(D1):D638-D646. doi:10.1093/nar/gkac1000

关键词: 蛋白质组学分析②:从静态到动态!用桑基图& GSEA & Mfuzz & PPI 深挖数据深层机制
相关资讯
双喜临门!谱度众合连获2026年“武汉市人工智能企业”和“武汉市大数据企业”双项殊荣
2026-07-30
谱度众合亮相贵州大学溪山生物医药创新论坛:高通量质谱技术驱动药物靶点精准筛选
2026-07-30
科研不容试错,标准铸就信任!谱度众合PRM靶向检测省级团体标准正式获批!
2026-07-30
业务咨询