新药研发中,如何低成本、高效地验证药物靶点和分子设计?

所属分类: 技术干货

发布时间: 2026-08-04

概要: 对于资金、设备有限的高校团队和初创药企,如何建立一套低成本、高效率、计算与实验结合的新药研发验证体系?


 


 


 

做早期新药研发的团队,往往都会遇到两个难题:

第一个难题:传统实验筛选成本高、周期长。

第二个难题:AI计算预测与真实药效之间存在距离。

很多研发团队拿到一个潜在靶点后,会直接进入蛋白验证、细胞实验甚至动物模型阶段,却忽视了前期数据验证的重要性。

那么,对于资金、设备有限的高校团队和初创药企,如何建立一套低成本、高效率、计算与实验结合的新药研发验证体系?答案并不是简单依赖某一种技术,而是通过:

多组学数据筛选靶点 → AI优化分子设计 → 蛋白质组学解析生物响应 → 实验验证确认 → 形成研发闭环。

让计算预测和实验数据相互反馈,减少无效投入,提高早期药物发现效率。

谱度众合持续深耕基于质谱技术的蛋白质研究领域20年,专注于互作蛋白筛选、药物靶点筛选、分子机制解析、生物标志物发现等具体研究场景,点击文末阅读原文,即可获取专属实验设计方案。


 

01 靶点源头:多组学数据+蛋白质组学,提前判断靶点价值


 

1. 公共数据库快速筛选候选靶点


 

对于预算有限的研发团队,可以优先利用公开数据库完成第一轮筛选。


 


 

① Open Targets:评估疾病关联性

Open Targets整合基因组学、遗传学、临床表型等多维数据,可以帮助研究人员评估某个基因或靶点与疾病之间的关联程度,并进行优先级排序。


 


 

② ChEMBL:分析已有药物化学空间

ChEMBL收录大量小分子与靶点相互作用数据,可用于了解:

是否存在已知活性化合物;

是否具有药物开发基础;

是否存在潜在脱靶风险。

通过数据库初筛,可以提前淘汰疾病关联弱、开发价值有限的候选方向,将资源集中到更有潜力的靶点。


 

2. 蛋白质组学验证:从“关联靶点”找到“功能靶点”


 

仅依靠基因组或转录组数据,并不能完全说明目标蛋白在疾病过程中发挥关键作用。

在真实生物体系中,蛋白才是执行功能的主要分子。因此,需要进一步回答:

这个靶点对应的蛋白是否真的发生改变?

蛋白质组学能够从蛋白表达和功能状态层面对候选靶点进行验证。

例如:

● 定量蛋白质组学

比较疾病状态与正常状态下蛋白表达差异,寻找真正异常变化的蛋白。

● 磷酸化蛋白质组学

分析异常信号通路激活情况,帮助发现疾病驱动机制。

● 蛋白互作分析

解析目标蛋白所在调控网络,判断其是否处于关键功能节点。

通过“数据库筛选+蛋白质组学验证”的策略,可以减少仅凭理论推测进入实验阶段带来的风险。对于研发资源有限的团队,也可以采用针对性蛋白质组检测方案,对关键样本进行精准验证,在成本和信息量之间取得平衡。

点击文末阅读原文,

即可获取蛋白质组学相关实验设计方案。


 

3. 蛋白动态结构分析:解决AI结构预测的局限


 

完成靶点评估后,下一步需要获得可靠的蛋白结构信息,为后续分子设计提供基础。

目前,AlphaFold等AI结构预测工具极大降低了蛋白结构获取门槛,但预测结构通常代表某一种稳定状态,无法完全反映蛋白在真实环境中的动态变化。而药物结合往往依赖蛋白构象变化。例如:

某些隐藏结合口袋可能只有在蛋白运动过程中短暂暴露;

某些小分子可能通过诱导蛋白构象变化发挥作用。

因此,需要结合分子动力学模拟,对蛋白结构进行动态优化。

通过潜在结合口袋分析、分子动力学模拟、动态构象变化分析,可以获得更加接近真实状态的药物结合模型,为后续虚拟筛选提供更可靠的基础。

02 突破化学空间限制:AI虚拟筛选发现潜在苗头分子


 

传统现货化合物库仅数百万分子,化学骨架同质化严重,难以产出具备专利新颖性的苗头分子;而百亿级按需合成库(Enamine REAL)包含750亿类药小分子。


 

1. 算力瓶颈解决方案:AI代理模型超高通量虚拟筛选(uHTVS)


 

直接对百亿分子全量物理对接算力成本极高,普通集群需数月运算,采用自适应靶向引导虚拟筛选(ATG-VS)降维策略,单机消费级GPU即可完成:

❶ 多样性子集采样:从百亿库中抽取百万级代表性分子;

❷ 精准物理对接打分:AutoDock-GPU并行计算子集分子结合分数;

❸ 训练AI代理模型:以分子二维/三维描述符+对接分值训练随机森林/深度神经网络;

❹ 全库极速预测:训练完成的模型毫秒级推断剩余全部分子活性,筛选Top0.001%高潜力化合物;

❺ 最终精细验证:仅浓缩后的高分子集开展全柔性对接、构象聚类。


 

2. 两套轻量化算力方案适配不同团队


 

03 多层级联合打分体系:减少无用合成采购


 

虚拟筛选最大资源损耗来源是假阳性分子 —— 对接分数虚高,但湿实验无结合活性。建立粗筛 → AI 深度学习重打分 → 共识打分 → MD自由能终筛四级过滤体系,逐级压缩候选分子数量。


 

1.一级粗筛:AutoDock-GPU批量生成结合构象


 

依托GPU并行能力快速输出分子多种结合姿态,但传统经验打分函数对立体化学、弱相互作用计算简化,仅用作构象生成,不做最终筛选依据。


 

2.二级核心过滤:GNINA 3D-CNN深度学习重打分(核心降噪步骤)


 

将AutoDock输出的复合物体素化,通过三维卷积网络自动提取蛋白-配体空间结合特征,不依赖人工预设能量公式。

实测数据:经GNINA CNNscore重打分后,前1%化合物早期富集因子(EF1%)是单一物理打分2倍以上,可直接剔除绝大多数严重假阳性分子。


 

3.三级共识打分:融合多算法消除单一工具偏差


 

任意打分函数均存在靶点适配局限性,采用多模型融合策略提升预测鲁棒性:融合Vina、GNINA、RTMscore多套打分排名,使用Z-score标准化、平均排名法整合结果;仅多工具同步排名靠前、构象应变能更低的分子进入下一阶段。


 

4.四级终局把关:MD+MM-GBSA自由能计算(采购前最后屏障)


 

静态对接忽略生理环境水分子、离子屏蔽、蛋白热运动,大量高分分子在水溶液中会快速脱离口袋。开源低成本流程:

OpenMM运行10–50纳秒短时MD平衡模拟;

gmx_MMPBSA批量计算MM-GBSA结合自由能,同步输出单残基能量分解图谱,判断分子是否与靶点核心功能残基形成稳定相互作用。

经自由能筛选后留存分子,体外活性实验成功率大幅提升,避免批量采购无活性化合物。

04 AI分子设计:从发现分子到优化分子


 

拿到苗头分子后,传统人工骨架优化效率低、易陷入专利壁垒,采用生成式AI工具完成多目标分子改造,同时前置拦截毒性干扰分子。


 

1. 开源强化学习分子生成:REINVENT 4


 

无需从零训练大模型,阿斯利康开源REINVENT 4适配早期研发需求,可设置多目标奖励函数同步约束:

保留核心药效团(如激酶铰链结合位点相互作用);

限定理化性质:LogP<5、合理TPSA区间;

自动剔除高活性危险基团、已知毒性片段;

搭配课程学习策略,逐步收紧约束条件,产出全新、可合成、具备知识产权差异化的分子骨架。


 

2. ADMET+PAINS双重拦截,规避实验假象


 

虚拟库中大量PAINS、SCAMs胶体聚集分子,会在生化实验产生假阳性信号,消耗验证资源,计算阶段强制两步过滤:

❶ ADMET-AI/DataPype毫秒级预测吸收、代谢、毒性、血脑屏障、P-gp抑制风险;

❷ RDKit亚结构检索,批量过滤高反应活性、荧光干扰、胶体聚集类干扰化合物,将无成药潜力分子拦截在合成采购之前。

05 低成本湿实验闭环:DSF热位移分析作为计算与实验的转换枢纽


 

经过多层计算筛选后,候选分子通常仅50–100个,不建议直接使用SPR、ITC、NMR等高成本设备初筛,搭建DSF分级验证体系,最大化节约蛋白、耗材、设备投入。


 

1. DSF(热位移TSA)核心低成本优势


 

对比主流生物物理表征手段,适配资源有限团队:


 

2. DSF完整验证流程


 

❶ 首轮大规模初筛:全部计算筛选候选分子上机DSF,记录蛋白熔解温度偏移ΔTm;仅ΔTm显著、通过Selwyn基线测试的分子标记为真实苗头;

❷ 高精度精细表征:仅筛选出的少数阳性分子送至平台/CRO,使用SPR/ITC测定KD、动力学结合常数;

06 轻资产研发底座:全开源工具链+弹性云端算力


 

多数早期团队成本浪费在商业CADD、分子模拟软件年费与自建GPU集群上,采用“工具开源化、算力云端化”架构实现轻资产运转:


 

1. 自动化开源计算管线搭建


 

依托Python、DeepMol、SCP框架串联全套免费工具:RDKit(化学信息处理)+AutoDock-GPU(对接)+GNINA(AI重打分)+OpenMM(MD模拟);敏感数据可使用浏览器端本地CADD工具,无需上传至外部服务器,保障数据安全。


 

2. 按需租用云端弹性算力


 

虚拟筛选、MM-GBSA模拟属于脉冲式算力需求,湿实验阶段算力闲置,采用竞价GPU实例按需租用,任务完成立即释放,将大额固定资产投入转为浮动运营成本。

总结


 

对于高校课题组、初创药企来说,只要坚守上述计算驱动结合层层低成本验证的组合策略,哪怕在资源高度紧缺的境况下,依然能够以惊人的速度和极低的试错成本,将具备极高成药潜力的全新化学实体平稳推入后续的全面药理学研究阶段,在惨烈的新药竞逐中把握真正的先机。值得注意的是:

AI可以预测:哪个分子可能与靶点结合。

但药物研发最终需要回答:这个分子进入细胞后,是否真正产生预期作用?

这也是计算预测与实验验证之间的重要鸿沟。

蛋白质组学能够从系统层面分析药物处理后的蛋白变化,帮助研发团队判断:

目标通路是否被调控;

药物作用机制是否符合预期;

是否出现潜在脱靶效应。

因此,在AI药物设计流程中加入蛋白质组学,可以形成:“AI分子设计 → 蛋白质组学机制分析 → 实验验证 → 数据反馈优化”的闭环模式。

这不仅能够提高候选分子的筛选效率,也能够帮助研发团队更早发现作用机制和潜在风险。

2026版产品目录 长图.png

点击文末阅读原文,

即可获取蛋白质组学相关实验设计方案

参考资料

1. Ferreira FJN, Carneiro AS. Artificial intelligence and machine learning in drug discovery: a comprehensive review of recent advances, methodologies, and challenges. ACS Omega. 2025;10(24):23889-23903. doi:10.1021/acsomega.5c00549

2. de Lima JAL, Franco LS, Lima LM. Big data for drug discovery: some historical landscape, considerations, and applications for a medicinal chemist. ACS Omega. 2026;11(7):6817-6833. doi:10.1021/acsomega.5c08828

3. Wang K, Huang Y, Wang Y, You Q, Wang L. Recent advances from computer-aided drug design to artificial intelligence drug design. RSC Med Chem. 2025;16(12):3978-3998. doi:10.1039/d4md00522h

4. Zhao L, Ciallella HL, Aleksunes LM, Zhu H. Big data in drug discovery and development: challenges and opportunities in the era of machine learning and deep learning. Drug Discov Today. 2021;26(9):2047-2062. doi:10.1016/j.drudis.2021.03.020

5. Sliwoski G, Kothiwale S, Meiler J, Lowe EW Jr. Computational methods in drug discovery. Pharmacol Rev. 2013;66(1):334-395. doi:10.1124/pr.112.007336


 

点击下方“阅读全文” 获取资料

关键词: 新药研发中,如何低成本、高效地验证药物靶点和分子设计?