|
  
- 积分
- 26744
- 威望
- 26744
- 包包
- 155812
|

Nat Chem Biol:上海药物所郑明月/张素林/王明亮团队推出超强亲和力预测模型,先导优化效率飙升
) }/ e" A0 E" {" T来源:iNature 2026-08-08 14:175 m2 l7 g F4 g
该研究提出PBCNet2.0,一种基于笛卡尔张量的孪生神经网络,用于预测蛋白质-配体相对结合亲和力。
0 D3 w& v1 a& i- I( B& u8 G" {加速分子探针发现及先导化合物的优化,需要准确且高效的结合亲和力预测。4 M" ]" \. o. z7 O9 i
2026年6月12日,中国科学院上海药物研究所郑明月、张素林及王明亮共同通讯在Nature Chemical Biology在线发表题为“Atomic-level protein–ligand recognition with PBCNet2.0 for probe discovery”的研究论文。该研究提出PBCNet2.0,一种基于笛卡尔张量的孪生神经网络,用于预测蛋白质-配体相对结合亲和力。该模型在860万个蛋白质-配体复合物对上进行训练,在零样本预测中达到与计算密集的基于物理模拟方法相当的准确度,同时保持极高的效率。
; e( A/ ]( a4 r# q; a p9 o回顾性优先排序实验表明,PBCNet2.0将优化效率提升了7.18倍,并将资源使用量减少了41%。机制分析显示,该模型能够捕获分子间交互作用并编码空间几何约束,从而具备对氟原子正交多极交互作用等细微效应的敏感性。值得注意的是,尽管未经过突变数据的训练,PBCNet2.0仍展现出一种涌现能力,可预测由结合位点残基变异引起的亲和力变化,从而支持耐药性分析。作者在ENPP1和ALDH1B1上对这些能力进行了前瞻性验证,成功解析了由微小交互作用和构象差异引起的亲和力变化,并识别出关键结合残基,在六个选定残基中命中五个。* H1 {! Y/ \' E; z" L$ _0 a
4 _8 l; {0 \1 ?2 v) |
人类基因组中蕴含着大量具有治疗潜力的蛋白质,但这些蛋白质的功能尚不明确且研究不足。导致这一资源未得到充分利用的一个关键因素是缺乏高质量且特性明确的分子探针。认识到这一空白后,国际“靶点2035”计划已启动,其宏伟目标是为所有人类蛋白质鉴定出药理学探针。
, X: b5 \8 }- q* r$ h( B+ n- z5 U在此背景下,蛋白质-配体结合亲和力预测在加速分子探针开发中发挥着关键作用。尽管基于物理学的方法(例如自由能微扰;如Schrödinger公司的FEP+)在预测相对结合亲和力方面已达到了化学精度(均方根误差约为1.1 kcal·mol⁻¹),但其高昂的计算成本、复杂的设置以及对专家干预的需求限制了其广泛应用。因此,深度学习通过直接从结构数据中学习,为高通量亲和力预测提供了机遇。
* B& {! J+ G' p5 u
5 b8 x6 f. G# c) K& ^7 p ~图1.PBCNet2.0的体系结构和应用概述(摘自Nature Chemical Biology )) s" p, f7 F) R# b
近期结合三维结构信息的深度学习模型在蛋白质-配体结合预测中展示了令人鼓舞的结果。作者团队开发的EquiScore是一种等变图神经网络(E-GNN),它整合了蛋白质-配体相互作用的物理原理,在虚拟筛选任务中表现出稳健的性能。与此同时,PIGNet2.0是一种物理信息增强的图神经网络,它通过显式建模多种蛋白质-配体相互作用来预测结合自由能,在虚拟筛选和先导化合物优化中均被证明是有效的。作者先前介绍了成对结合比较网络(PBCNet),这是一种带有物理信息增强图注意力机制的孪生神经网络(Siamese neural network, SNN),通过输入成对的蛋白质-配体复合物来预测相对结合亲和力,其所用的亲和力标签源自相同的实验测定,以最小化大规模亲和力数据库中常见的系统误差。尽管PBCNet相较于现有高通量方法显示出显著优势,并且在微调后能达到与Schrödinger公司的FEP+相似的性能,但在零样本预测方面仍存在性能差距。
* W% }: B2 j1 d. s3 |2 a/ N/ c作者确定了两个主要局限性。首先,PBCNet的训练数据集虽经过精心筛选,但仅包含约2万个独特小分子和960个蛋白质靶点,代表了有限的化学空间和生物空间。已在蛋白质结构预测和大语言模型中得到验证的规模定律表明,模型性能与数据量和模型复杂度呈正相关。因此,有限的训练规模可能会限制其在不同化学结构和蛋白质家族间的泛化能力。其次,PBCNet的几何编码方法引入了固有约束。该模型使用了原子成对统计势(APSPs)和角度编码模块,这些模块依赖预定的几何特征和固定的角度区间。这限制了模型学习特定于上下文的相互作用的能力,并且对于预定义APSP集之外的新型原子类型可能并非最优。这些几何约束可能阻碍对异常结合模式的检测,尤其是在配体化学性质非标准的系统中。
. v" X- E. k' a; R" V# F5 O为解决这些局限性并推动蛋白质-配体结合亲和力预测领域的发展,作者提出了PBCNet2.0,这是一种利用E-GNN的下一代模型。作者的方法基于人工智能近期进展中的两个关键见解。首先,受规模定律启发,作者将训练数据集扩展至包含来自BindingDB的860万个蛋白质-配体复合物对,这比PBCNet原始数据集增加了14倍。扩展后的数据集涵盖了28万个独特小分子和1,122个蛋白质靶点,从而能够更全面地学习多样的相互作用模式。其次,作者对模型架构进行了根本性重新设计,实现了基于笛卡尔坐标的E-GNN框架用于消息传递。这种方法通过等变变换自然地编码三维结构关系,超越了PBCNet对预定义势函数的依赖,直接从数据中学习几何约束。; w f! H" |2 }4 H) F
本研究通过以下几个方面探讨了这些创新。首先,作者评估了PBCNet2.0在与基于物理学和深度学习的基线方法相比时的先导化合物优化任务性能,通过消融实验和扰动实验分析了其捕获蛋白质-配体相互作用的能力,并展示了预测口袋突变引起的亲和力变化的涌现能力。然后,作者通过对两个药物靶点——外核苷酸焦磷酸酶/磷酸二酯酶1(ectonucleotide pyrophosphatase/phosphodiesterase 1, ENPP1)和醛脱氢酶1B1(aldehyde dehydrogenase 1B1, ALDH1B1)——进行前瞻性实验,验证了作者的发现,展示了该方法在真实世界的分子探针开发和先导化合物优化场景中的实用性。1 n# r0 K! ] t
参考消息:https://www.nature.com/articles/s41589-026-02241-x
' v" Q: R e/ O+ I/ h
& o+ o0 U r# a! N; m+ [" m0 n |
附件: 你需要登录才可以下载或查看附件。没有帐号?注册
|