质谱报告里的Data、Plot、Protein、Peptide、Score分别怎么看?

所属分类: 技术干货

发布时间: 2026-09-10

概要: 一位做了20年质谱的老技术员,跟你聊聊拿到报告后该从哪看起


 


 


 

前阵子帮一个客户复盘一批临床样本的label-free数据。对方开口就问:"我们鉴定到5200个蛋白,这个数据量可以吧?"我没急着回答,先把TIC图调出来 —— 三张重复里面有一张信号突然腰折,半天才缓过来,这种数据,蛋白数再好看也得打个问号。做了20年质谱,最常被问的就是"鉴定了多少蛋白"。好像那个数字就是一切。但一份质谱报告真正有价值的信息,远不止Protein那一列。

这篇文章,我们来把Data、Plot、Protein、Peptide、Score五个模块挨个拆开,帮你建立一套看报告的思路。

点击文末阅读原文,

获取专属蛋白质组学实验方案~


 

一、拿到质谱报告,第一眼应该看什么?


 


 

报告里的五个模块,分别在说什么


 

不管用MaxQuant、Proteome Discoverer还是Mascot,一份标准质谱报告通常包含这几块:

Data:原始文件、仪器参数、色谱梯度、酶解条件、搜库数据库——决定所有结果可信度的底层信息。

Plot:TIC、BPC、MS/MS谱图——数据采集有没有出问题,图上一眼就能看出来。

Peptide:肽段水平的鉴定结果——PSM数、unique/shared、打分,是蛋白鉴定的"原材料"。

Protein:蛋白水平的汇总——蛋白组、覆盖度、综合打分,最需要带着批判眼光看。

Score:肽段和蛋白的打分——筛选结果的重要依据,但不同软件的分数完全不是一个量纲。

为什么不能只盯着Protein数量


 

回到那个客户的问题来看,5200个蛋白听着不少,但把TIC图调出来细看,其实问题不少。我们发现,近300个蛋白只有1个shared peptide支撑,一批角蛋白和胰蛋白酶污染没去掉,还有几个分数卡在阈值边缘的"擦边球"蛋白。去掉这些,真正可靠的鉴定大概4300出头。

同样是"鉴定到5000个蛋白",FDR设1%和设5%出来的结果质量天差地别;用Swiss-Prot和用TrEMBL数据库,数字也会差很多。不看条件只看数字,等于白看。

所以说,看质谱报告要建立自下而上的证据链:

原始谱图 → 碎片丰不丰富、信噪比高不高、b/y系列完不完整

PSM → 一张谱图匹配一个肽段,打分多少

肽段 → 去冗余后的序列,unique还是shared

蛋白 → 由若干肽段"拼"出来,证据够不够硬

谱图→PSM→肽段→蛋白,底层不稳,上层数字再好看也不可信。


 

二、Data和Plot:先看数据质量,再看结果


 

我每次拿到新数据,第一件事从来不是看鉴定了多少蛋白,而是把TIC图调出来。


 

Data里要关注什么


 

采集模式:DDA还是DIA,直接影响后续分析策略

色谱梯度:时长、流速、色谱柱型号——决定峰容量和分离度

酶解信息:用什么酶、允许几个漏切——漏切太多可能意味着酶解不充分

修饰设置:固定修饰( Carbamidomethyl C)、可变修饰(氧化M、乙酰化等)——设错了会大量漏鉴定

数据库:用什么库、什么版本——UniProt几个月更新一次,跨版本比较要注意

image.png

图1. 复杂样品的总离子流色谱图(TIC)。三张生物学重复叠加,可直观比较重复性和信号强度。图片来源:ResearchGate公开文献。

TIC:看整体状态,找异常


 

TIC是每个时间点所有MS1离子强度的总和。正常的TIC应该是:前几分钟信号低(脱盐阶段),随有机相升高形成宽的"山丘"状分布,梯度末端逐渐回落,整体平滑无突变。

这些异常要警惕:

前段出现又高又尖的峰——上样残留或强极性杂质(盐、去垢剂)冲出

某个时间点突然掉到接近零又恢复——电喷雾断了(喷针堵了又通、液面波动)

梯度末端出现大峰——色谱柱残留强疏水物质被冲出,每次都有说明柱子该洗了

三张重复整体强度差一倍以上——上样量差异大或某针离子化有问题,定量要小心

image.png

图2. 肽段标准品的基峰色谱图(BPC)。14个标准肽段分离良好,峰形尖锐对称,是色谱状态良好的典型表现。图片来源:Sigma-Aldrich技术资料。


 

BPC和MS/MS谱图:看分离和鉴定细节


 

BPC只取每个时间点强度最高的离子,比TIC更能看清单个肽段的峰形和分离度。看BPC主要看峰容量(梯度内能分辨多少独立峰)和峰形(对称高斯形为好,拖尾说明柱效下降或溶剂效应)。

MS/MS谱图是鉴定的根本。一张好谱图应该碎片丰富、b/y离子系列完整、信噪比高、基线干净。我做项目有个习惯,随机挑几张谱图亲自看——如果一张谱图只有三四个碎片峰,软件却给了高分,这种匹配很可能是碰巧对上的。

image.png

图3. 两个代表性肽段的标注MS/MS谱图。图片来源:Creative Proteomics公开资料。

快速判断数据采集是否正常

TIC整体形态正常,无断崖、无异常尖峰

BPC峰容量够、峰形对称

随机抽查5-10张MS/MS谱图,碎片丰富、b/y系列完整

电荷态分布以2+为主,鉴定数在预期范围(如HeLa全蛋白、60分钟梯度、DDA模式,3000-5000个蛋白属正常)

三、Peptide:蛋白是怎么被"鉴定"出来的?


 


 

image.png

图4. Bottom-up蛋白质组学工作流程。蛋白经酶解为肽段,LC分离后质谱采集,MS/MS谱图经数据库搜索完成鉴定。图片来源:The Analytical Scientist。


 

质谱测的不是完整蛋白,是肽段


 

目前绝大多数蛋白质组学用bottom-up策略:先把蛋白用胰蛋白酶切成肽段,质谱测的是这些肽段。蛋白的身份是通过"它产生了哪些肽段"来推断的。

这意味着:你看到的"鉴定到蛋白X",本质是"检测到了若干个可归属于蛋白X的肽段"。如果这些肽段证据不够硬,蛋白X的鉴定就存疑。


 

PSM、Peptide Sequence、Unique Peptide,别搞混


 


 


 

PSM(Peptide-Spectrum Match):

最底层,一张MS/MS谱图匹配一个肽段序列。同一个肽段被多次检测到就会产生多个PSM。


 


 

Peptide Sequence:

去冗余后的肽段序列,同一序列不管被检测多少次只算一个。肽段数≤PSM数。


 


 

Unique Peptide:

在数据库中只属于一个蛋白的肽段 —— 检测到它就意味着这个蛋白一定存在。


 


 

Shared Peptide:

同时出现在两个或更多蛋白中的肽段,常见于同源蛋白、蛋白家族、剪接变体。告诉你"这个家族至少有一个成员存在",但没法确定具体是哪一个。

image.png

图5. 肽段碰撞诱导解离(CID)与MS/MS碎片离子标注示意。图片来源:NCBI Bookshelf。


 

Unique Peptide为什么这么重要


 

讲一个真实的项目案例。前几年做肿瘤标志物筛选,差异蛋白里发现一个很有前景的激酶候选,ELISA验证也做了,课题汇报过了两轮。后来细看肽段证据 —— 支撑它的3个肽段全是shared peptide,同时属于同家族另一个激酶,而那个同源激酶的表达量是候选蛋白的十几倍。

用针对候选蛋白unique peptide的抗体做PRM验证,根本检测不到。那几个shared peptide大概率来自高丰度同源蛋白,软件把它们分配给了低丰度候选。项目差点走了弯路。

可靠的蛋白鉴定至少需要1-2个unique peptide。没有unique peptide支撑的,一律按"待验证"处理


 

Peptide多≠鉴定更可靠


 

三个常见的坑:

peptide多但全是shared的——10个shared不如1个unique有说服力

peptide多但PSM质量差——大量分数挤在阈值附近的"擦边球",假阳性率高

peptide多但集中在蛋白某个区域——比如500aa的蛋白,15个肽段全集中在N端100aa,C端完全没覆盖,无法排除截短体或剪接变体

看peptide要同时看质量(打分分布)、性质(unique/shared比例)、分布(序列覆盖均匀度)。

四、Protein:不要只看"鉴定到了多少个蛋白"


 

Protein ID、Protein Group、Protein Score


 


 

Protein ID:

蛋白在数据库中的登录号(如UniProt accession),唯一标识,可查完整序列和功能注释。


 


 

Protein Group:

因为shared peptide的存在,有些蛋白无法通过肽段证据区分,软件把它们归为一组。MaxQuant里选肽段证据最多的做master protein,其他列在后面。proteinGroups.txt里多个ID用分号隔开就是一个group。


 


 

Protein Score:

蛋白水平的综合打分。Mascot是超阈值肽段ion score的加和;Proteome Discoverer是肽段置信度的加权综合值;MaxQuant默认用PEP和FDR控制质量。score高不等于绝对可靠,还要看FDR和unique peptide数。


 

Sequence Coverage是什么


 

Sequence Coverage是鉴定到的肽段覆盖的氨基酸数占蛋白总氨基酸数的百分比。高丰度蛋白的coverage通常较高,但coverage和丰度绝不是等价关系。

coverage受蛋白长度(短蛋白更容易高coverage)、酶解效率、肽段离子化效率、跨膜区(膜蛋白coverage通常偏低)等多种因素影响。它的正确用法是:同一蛋白不同条件间的比较(提示降解或截短),或作为鉴定可靠性的辅助证据。不要拿它直接当丰度用。

image.png

图6. 基于高分辨质谱的蛋白序列鉴定与覆盖度分析流程。图片来源:MtoZ Biolabs公开资料。


 

Shared Peptide的处理:razor peptide


 

蛋白推断的核心是"奥卡姆剃刀"原则 —— 能用最少的蛋白解释所有肽段,就不引入更多蛋白。

MaxQuant里的razor peptide就是这个逻辑:一个shared peptide同时属于多个蛋白组时,分配给unique peptide最多的那个组 —— 因为它的证据最充分,这个shared peptide最可能来自那里。但razor的分配是概率推断,不是确定事实,所以定量时默认只用unique+razor peptide,shared peptide不直接参与定量。


 

判断一个Protein的鉴定证据是否充分


 

unique peptide≥2个(只有1个的话,该肽段谱图质量要特别好,最好有多个PSM)

protein score远高于阈值,或PEP远小于0.01

sequence coverage>5-10%(短蛋白和膜蛋白特殊对待)

在1% protein-level FDR以内

不是常见污染蛋白(角蛋白、胰蛋白酶、BSA等)

五、Score:分数越高,结果就越可靠吗?


 


 

Score在评价什么


 

搜库打分的本质是衡量实验MS/MS谱图和理论肽段谱图的匹配程度。软件根据肽段序列预测应该产生哪些b/y碎片离子,然后和实验谱图的峰做比对 —— 匹配越多越准,分数越高。


 

Peptide Score vs Protein Score


 


 


 

Peptide score:

肽段水平,针对单个PSM。常见的有Mascot ion score(-10×log10(P),概率打分)、Andromeda score(概率打分,针对高分辨率优化)、SEQUEST XCorr(互相关打分,量纲完全不同)。


 


 

Protein score:

蛋白水平汇总,通常是该蛋白下所有肽段打分的组合。Mascot官方明确说过,MS/MS搜索中的protein score不是概率估计,只是方便排序的数值。真正的可靠性要看FDR。


 

不同软件的Score不能直接比较


 

这是很多人踩过的坑。Andromeda(MaxQuant)的论文里专门比较过:Andromeda score和Mascot score大致满足 M = 0.311×A - 32.231,也就是说Andromeda的分数大约是Mascot的3倍。这不是因为Andromeda"更灵敏",而是打分尺度不一样。

SEQUEST的XCorr就更不一样了,通常在1-5之间。拿XCorr=3和Mascot score=80比,就像拿3米和80公斤比大小——完全不是一个东西。跨软件比较鉴定结果,应该在统一FDR阈值下比鉴定数量或overlap,而不是比score。


 

Score和FDR必须结合起来看


 

单独看score的根本问题是:你不知道多少分算"够高"。数据库越大,随机匹配概率越高,阈值就越高。FDR解决了这个问题。


 


 

target-decoy策略的原理:

搜库时除了目标数据库(target),还加入反向序列的诱饵数据库(decoy)。decoy是人造的,样品中不可能存在,所以匹配到decoy的一定是假阳性。把所有PSM按score排序,数到某个位置时target数为T、decoy数为D,FDR≈D/T。设定1% FDR就是找到FDR=0.01对应的score位置,只保留高于它的PSM。

FDR是统一的、可比较的质量指标——不管用什么软件、什么参数,1% FDR的含义一样。这就是为什么审稿人一定会问FDR设置,而不是问score阈值。


 

"1% FDR"到底意味着什么


 

一个被广泛误解的概念。1% FDR不是"每个鉴定到的蛋白都有99%的概率是真的",而是"在所有通过筛选的鉴定结果中,预期有1%是假阳性"。

比如说在1% FDR条件下鉴定到了5000个蛋白,预期其中约50个是假阳性,但你不知道具体哪50个。因为每个蛋白的实际置信度差别很大 —— score特别高的几乎是真的,刚好卡在阈值附近的可能只有90%多。

还要区分三个层面的FDR:PSM-level、peptide-level、protein-level,计算方式和阈值可以不一样。MaxQuant默认三个层面都设1%。对于特别重要的结论,最好用Western blot、PRM、ELISA等正交方法验证。

六、一份质谱报告到底应该怎么看?


 

用四个"不一定"收尾,这是我这些年见过最多、也最容易导致错误结论的误区。


 

Protein越多,不一定越好


 

鉴定数受FDR阈值、数据库大小和版本、搜库参数、样品质量、梯度时长、仪器灵敏度等太多因素影响。为了追求数量把FDR放到5%,或者把只有1个shared peptide的蛋白也算进去,多出来的蛋白里有相当比例不可靠,会污染后续的差异分析和富集分析。我更看重的是:严格1% FDR下鉴定数是否合理、重复间overlap多高、定量CV多大。


 

Score越高,不一定绝对可靠


 

Score是相对指标,含义取决于软件、数据库和参数。Mascot 80和Andromeda 200可能置信度差不多。而且score高只说明谱图匹配得好,不代表蛋白身份一定对——高质量谱图匹配到错误肽段(数据库缺正确序列、修饰设错),score也可能很高。必须结合FDR,关键蛋白还要亲自看谱图。


 

Coverage高,不代表蛋白丰度高


 

Coverage和丰度有相关性但绝不等价。100aa的小蛋白2个肽段就有30% coverage,5000aa的巨蛋白20个肽段可能还不到5%。膜蛋白因跨膜肽段难检测,coverage通常偏低。要比较丰度请看LFQ intensity、iBAQ、TMT reporter ion这些专门的定量指标。


 

Peptide多,不等于证据一定强


 

很多时候,10个shared peptide还不如2个unique有说服力。同样20个score刚过阈值的"擦边球",不如5个高分高质量肽段。15个集中在N端的肽段,不如8个均匀分布的。所以,肽段证据讲究多维度考量,同时看质量、性质、分布,都过关才行。

写在最后


 

质谱技术发展到今天,仪器越来越灵敏,软件越来越智能,但恰恰是在这种"数据爆炸"的时代,我们更需要回到基本面,认认真真看每一张谱图、每一个肽段、每一个打分。软件可以帮你完成搜库、打分、FDR控制,但它不能替你判断一个结果是否可信、一个发现是否有意义。

点击文末阅读原文,

获取专属蛋白质组学实验方案~


 


 


 


 

关于我们

谱度众合是一家由武汉大学生科院博士团队创办的“国家高新技术企业”,持续深耕基于质谱技术的蛋白质研究领域20年,区别于一般组学公司仅提供检测数据和常规分析,谱度众合针对特定研究目的开发最优解决方案(例如:互作蛋白筛选、药物靶点研究、分子机制解析、生物标志物发现等),帮助医学和农学科研工作者提高实验成功率2倍以上,极大加速研究进程。

左右滑动查看更多


 


 


 

点击下方“阅读全文” 获取资料

关键词: 质谱报告里的Data、Plot、Protein、Peptide、Score分别怎么看?