蛋白组和转录组为什么会结果不一致?

所属分类: 技术干货

发布时间: 2026-09-24

概要: 蛋白组学和转录组学结果不匹配,实验是不是失败了?


 


 


 

“我们做了转录组,这个基因水平上调三四倍,但蛋白的结果连1.2倍都不到,你们质谱是不是没测准?”这种问题我每周都要解释两三遍。

大家拿到这样的结果,不用急着怀疑。今天这篇文章,我们就来给大家解释清楚:转录组和蛋白组的本质区别,其实它们之间的相关系数仅为0.2到0.5。蛋白组学和转录组学结果不匹配,甚至完全相悖,都并不代表实验失败,可能是生物学本来的样子。

点击文末阅读原文,

获取专属蛋白质组学实验方案


 

一、先摆数据:两者对不上,是常态


 

做联合分析之前,先把预期摆正。大规模平行测同一批样本的mRNA和蛋白质,相关系数通常为0.2–0.5。这个数字并非仅源自某一篇文章的结论,而是被反复验证的经验区间。

我把自己印象比较深的几组队列数据列一下:

早期结直肠癌队列,肿瘤组织里mRNA-蛋白相关系数大约0.23;

盖15种癌型的泛癌分析,区间在0.30–0.50;

肺腺癌的CPTAC队列,大约0.53,已经算高的了;

相对稳定的哺乳动物细胞系(如NIH/3T3),经过误差校正后相关系数也仅有0.40–0.60;

单细胞层面的相关性则直接接近零,基本被泊松噪声掩盖。

一个值得注意的数量级问题:

转录组的动态范围大约跨4个数量级,蛋白质组则为8个。两者的“量纲”不在一个尺度,因此无法点对点对齐。因为,转录组反映的是某一时刻的转录输出,蛋白质组反映的是经过翻译与选择性降解后的终末丰度,两者之间隔着转录后调控、翻译、降解一整套过程。

原因可以归成两大类:细胞自身的生物学调控,和我们手上仪器的技术局限。下面分开讲。

二、生物学层面:细胞压根没打算让你对上


 

1. 半衰期不一样,你采的是两个时间点


 

mRNA半衰期通常为几分钟到几小时,但蛋白质相对稳定,几十小时到几天都较为常见。

我们曾做过的一个药物时间梯度项目:

加药后2小时收样,转录组里很多应激基因上调十几倍,但其对应的蛋白丰度几乎没有变化。原因是蛋白从合成到累积到新的稳态,滞后以小时计。在2小时这个时间点做横截面采样,转录组反映的是即时转录反应,蛋白组反映的是过去十几个小时的累积结果 —— 两个时间尺度的测量无法直接对齐。

做时间序列设计时,这个时间差一定要留够。早期时间点的转录组和同期蛋白组对不上,九成是这个原因,不是仪器坏了。


 

2. 翻译效率不是常数,差着好几个数量级


 

很多人默认“mRNA多,蛋白就多”,是线性关系。实际上并非如此。

Schwanhäusser的经典动力学测算显示:单个细胞的平均蛋白拷贝数大约为17万个;而一个mRNA分子,平均翻译近9800个蛋白拷贝,最大翻译率甚至能达到每小时合成近千个蛋白。由此可见,不同基因之间,翻译效率相差好几个量级。

更关键的是,该模型发现翻译速率和mRNA丰度不是简单正比:mRNA越高的基因,单条mRNA被翻译得越“卖力”,蛋白水平是被指数式放大的,放大指数受基因自身序列特征调控。后来还有从进化适应度角度建立的模型:细胞在转录成本(和mRNA拷贝数挂钩)与翻译成本、蛋白毒性之间找平衡,推出来的mRNA-蛋白缩放指数下限是0.5——蛋白越容易有毒的基因,越要靠堆mRNA来压住噪声。

一句话:mRNA丰度只是蛋白丰度的一个起点参数,中间隔着翻译效率这个大变量。


 

3. 蛋白质丰度受互作网络决定,未组装亚基会被降解


 

这是近几年CPTAC大数据里我觉得最有意思的发现。研究者把基因按“蛋白丰度谁说了算”分成两类:


 


 

自我驱动型(self-driven):

蛋白水平主要由自己的转录本决定。这类基因mRNA半衰期短、反应快,RNA丰度确实能较好地预测蛋白,比如一些独立工作的酶、应激蛋白。


 


 

互作驱动型(interactor-driven):

蛋白水平不依赖于mRNA,而依赖于其互作蛋白的表达量。典型代表是核糖体亚基蛋白:合成后,若无法组装成稳定的多聚复合物,会立刻被泛素-蛋白酶体系统清除。

核糖体亚基是最典型的例子:一个核糖体有八九十种蛋白,得按化学计量学严格配齐。你把其中一种的mRNA敲高两倍,其他七种没跟上,多出来的那部分根本留不住,当场降解。这时候你测它的mRNA涨了、蛋白没动,太正常了——不是技术问题,是蛋白组装不下你多给的那一份。

单细胞层面的研究也印证了这件事:这种蛋白清理机制,是维持单细胞蛋白稳态、也是让单细胞蛋白共变异模式和转录组脱节的关键原因。


 

4. 翻译缓冲:转录波动在蛋白层面对冲


 

即转录组检测到mRNA存在显著变化,但细胞在翻译层面或者蛋白降解层面发生反向代偿,导致最后蛋白输出基本不变。

有研究把转录组、翻译组和蛋白组放一起做张量分解,确实捕获到两种模式:


 


 

① 核糖体堆叠:

mRNA和翻译信号都涨,蛋白反而降;


 


 

② 翻译缓冲:

蛋白波动幅度远小于mRNA。

这说明细胞对关键通路(比如氧化磷酸化、蛋白稳态)在翻译层主动抑制转录波动。

所以当看到大量mRNA变化但其蛋白水平不受影响,可以考虑这组基因是不是在缓冲阶段。

三、技术层面:你看到的不一致,可能是质谱自己造出来的


 

1. TMT/iTRAQ的“比值压缩”,是做多组学最容易翻车的地方


 

使用TMT、iTRAQ这类等重标签做定量,需要先了解“比值压缩”。


 


 

原理:

DDA模式下,母离子选择窗口一般为0.4–1.2 Th。窗口里除了目标肽段,还存在质量和保留时间相近的背景肽段。二者在各个TMT通道里几乎是1:1等量分布的,因此目标肽段真实的组间差异,会被背景信号一稀释,测出来的差异会比实际偏小。


 


 

结果:

转录组里清楚上调数倍的基因,到蛋白组里FC压得很小,过不了差异阈值。你以为是翻译缓冲,其实是仪器把真实差异压缩了。


 


 

常用解决方案:

❶ FAIMS(高场不对称波形离子淌度)作为离子接口加在Orbitrap上,靠淌度差异把干扰肽挡在外面。文献里报过,嵌合MS/MS谱图比例能从50%降到27%,TMT比值压缩明显缓解。

❷ TIMS-PASEF(布鲁克平台)把离子淌度和质量关联起来,测序速度和灵敏度都上来了,还清掉一堆单电荷化学噪声,检测下限推到pg级——这也是单细胞蛋白组能起来的硬件基础。

❸ RTS-SPS-MS3(赛默飞)走MS2之后先实时在数据库里搜一遍,确认是哪条肽段,再触发高分辨MS3来提取标签定量,专治比值压缩,同时保留蛋白覆盖率。

image.png

图1  TMT等重标签定量中的比值压缩。共分离的背景肽段在各通道近似1:1分布,把目标肽段的真实倍数差异稀释、压缩(示意图)。

2. DDA和DIA,选哪个直接影响你能不能“对上”


 

这是我现在给客户做方案时必讲的一点:


 


 

传统DDA:

随机挑强度高的母离子打碎。扫描速度有限,大批低丰度肽段经常被漏掉,跨样本缺失值多,定量CV普遍高于15%。缺失值一多就得做人手填补,一填补就引入噪声,多组学一整合,假不一致就出来了。


 


 

DIA:

把质荷比窗口按宽带系统扫一遍、全部碎裂存档。数据完整性通常能到78%以上,CV普遍压到10%以内,低丰度蛋白抓得住,重现性好。文献里反复验证过,DIA定量出来的蛋白-mRNA相关性比DDA高。

做大队列多组学,我现在基本首选DIA。DDA只在追求深度鉴定、样本量小的时候考虑。


 

3. 样本一切两半,是临床多组学最隐蔽的坑


 

实体瘤样本存在很强的空间异质性,即把一块瘤组织分为两部分,一半提取核酸、一半提取蛋白,但这这两部分的细胞群分布可能不一样。这种“人为不一致”在数据处理阶段无法被发现,导致最后呈现“生物学不一致”。

正确做法是用共提取流程:从同一份匀浆裂解液里先后把RNA和蛋白分出来,确保测的是同一个生物学实体。做临床样本的人,这一步能避免大量后续无法回溯的系统偏差。

四、单细胞:不一致到了极端,但结论反着来


 

在单细胞层面:scRNA-seq存在“细胞一分散开,转录组噪声巨大”的问题。

造成这个局面的原因:单个细胞里绝大多数基因的mRNA拷贝数就个位数,但转录过程属于爆发式进行,数据会被泊松噪声主导。

但等超高灵敏度的单细胞蛋白组(SCoPE2这套思路:mPOP微量前处理加CellenONE挑细胞、TMT/TMTpro标记,配合TIMS-qTOF)真正测进去之后,看到的东西反直觉:不管细胞在分化还是在受扰动,单细胞里有一套高度稳定、被严格调控的“核心蛋白组”,而同批细胞的转录组倒是剧烈波动。这说明仅凭转录组数据推断单细胞功能表型是存在系统性偏差的。

五、中间那层:Ribo-seq一上,相关性立刻上来


 

既然mRNA≠蛋白,那测“正在被翻译的mRNA”不就桥接了吗?这就是Ribo-seq(核糖体图谱)。

RNA-seq测的是总mRNA,里面混着P小体里被封存、根本不翻译的部分。Ribo-seq用核酸酶消化,把真正被活性核糖体包住的那段28–32个核苷酸的RPF富集出来测序,还自带三核苷酸周期性,即哪条mRNA此刻正在被翻译延伸。

桥接效果是立竿见影的:

RNA-seq和蛋白定量的相关系数大约0.46;

换成Ribo-seq(翻译组)去配蛋白组,相关系数升高到0.71。

这完全匹配了转录组和蛋白组之间的“不一致”,说明主要原因在于翻译效率。而Ribo-seq通过单独计算翻译效率,就能实现转录事件和翻译调控事件的分别呈现。

附带一个福利:Ribo-seq是密码子级分辨率,能挖出很多常规参考序列里没有的东西——非经典翻译起始位点、短开放阅读框(sORF)、上游开放阅读框(uORF)编码的多肽。把这些做成定制化搜索库喂给质谱,能找到Swiss-Prot里根本没有的“暗物质”蛋白。

六、九象限图实战:每个象限都别当异常值丢掉


 

联合分析做完,大家都会画九象限图:X轴是mRNA的log2 FC,Y轴是蛋白的log2 FC,切九个格。我自己看这张图的习惯是,先别急着找“一致区”的基因,先看那些“不一致”的格子——那里才是信息。


 


 

右上 / 左下(同向一致区):

转录和蛋白同涨同跌,说明这组基因是转录层硬调控的,比如转录因子直接控制的效应通路。这些是做功能验证最省心的候选,RNA是蛋白的好预测。


 


 

左上 / 右下(反向区):

RNA涨了蛋白反而跌,或者反过来。最经典的解释是蛋白正在被急速降解——细胞为了补回被清掉的蛋白,代偿性地把mRNA往上调。这里面可能藏着泛素-蛋白酶体被靶向激活的线索。


 


 

沿Y轴(仅蛋白变):

mRNA稳着,蛋白变了。这就是前面说的“互作驱动型”蛋白——复合物里某个亚基变了,化学计量失衡,整组蛋白跟着累积或降解。药物诱导降解、RNA结合蛋白抑制翻译,也都落在这。


 


 

沿X轴(仅mRNA变):

蛋白水平无变化。这是典型的翻译缓冲现象;也可能是非编码剪接变异体,RNA-seq数到了但根本不翻译成蛋白。

结语


 

做了这么多年多组学,我自己的体会是几句话:

别追求“转录组和蛋白组全部对上”。r=0.3–0.5才是正常水平,对不上不是失败。

阈值分开设。转录组可以用2倍,蛋白组特别是TMT/DDA数据,用1.2–1.5倍更合理。

样本制备别省共提取这一步,尤其是临床组织。切两半跑两个流程,省的是一天工时,埋的是半年的坑。

预算允许的话,加一组Ribo-seq,比你在转录组和蛋白组之间来回猜要高效得多。

九象限图里那些“不一致”的格子,才是课题里真正可能出新东西的地方。一致的区域是验证,不一致的区域才是发现。

转录组告诉你细胞“打算干什么”,蛋白组告诉你细胞“实际在干什么”。这两句话之间的缝隙,就是我们做蛋白组的人要去填的地方。

点击文末阅读原文,

获取专属蛋白质组学实验方案

参考资料

1. Liu Y, et al. Interplay of transcriptomics and proteomics. PubMed: https://pubmed.ncbi.nlm.nih.gov/14662396/

2. Experimental reproducibility limits the correlation between mRNA and protein levels. PMC: https://pmc.ncbi.nlm.nih.gov/articles/PMC9499981/

3. mRNA-Protein Coordination is Contextualized by Metastatic State. bioRxiv: https://www.biorxiv.org/content/10.1101/2025.02.15.638428v3.full-text

4. Relating transcriptomics to protein abundance reveals self-driven versus interactor-driven proteins. https://www.researchgate.net/publication/414382530

5. Kidney mRNA-protein expression correlation: What can we learn from the Human Protein Atlas. https://www.researchgate.net/publication/382338505

6. What is Translatomics? The Missing Layer in Gene Expression. https://www.immaginabiotech.com/what-is-translatomics-the-missing-layer-in-gene-expression

7. Quantitating translational control: mRNA abundance-dependent and independent contributions. PMC: https://pmc.ncbi.nlm.nih.gov/articles/PMC5714229/

8. Schwanhäusser B, et al. Global quantification of mammalian gene expression control. Nature 2011Brunner A-D, et al. True single-cell proteomics using advanced ion mobility mass spectrometry. https://edoc.ub.uni-muenchen.de/28079/

9. Ultra-high sensitivity mass spectrometry quantifies single-cell proteome changes upon perturbation. bioRxiv: https://www.biorxiv.org/content/10.1101/2020.12.22.423933v2.full-text


 

点击下方“阅读全文” 获取资料

关键词: 蛋白组和转录组为什么会结果不一致?