中文

Pearl:一种用于将每个原子置于正确位置的基础模型

机器学习 2025-10-30 v2 定量方法

摘要

准确预测蛋白-配体复合物的三维结构是计算药物发现中的一项基本挑战,限制了疗法设计的速度和成功率。深度学习方法最近在结构预测工具方面取得了良好的潜力,跨越 diverse biomolecular 系统实现了有希望的准确性。然而,其性能和实用性受限于稀缺的实验数据、低效的体系结构、物理上无效的构象以及在推断时未能充分利用可用的辅助信息。为此,我们提出 Pearl(Place Every Atom in the Right Location),即一种规模化的蛋白-配体共折叠基础模型。Pearl 通过三项关键创新来解决这些挑战:(1)包括大规模合成数据的训练配方,以克服数据稀缺问题;(2)采用 SO(3) 等效扩散模块的体系结构,本质上尊重 3D 旋转对称性,提高了泛化能力和样本效率;(3)可控推断,包括通用的多链模板系统,支持蛋白质和非聚合物成分,以及双模式的无条件/条件模式。Pearl 在蛋白-配体共折叠中建立了新的国际前沿性能。在关键指标——生成准确(RMSD < 2 Å)且物理上有效的构象方面,Pearl 在公开的 Runs N' Poses 和 PoseBusters 基准测试中超越了 AlphaFold 3 和其他开源基线,分别实现了 14.5% 和 14.2% 的提升。在口袋条件下的共折叠情境中,Pearl 在专为具有挑战性真实药物靶点设计的专有数据集上实现了 3.6×3.6\times 的提升,达到了更严格的 RMSD < 1 Å 阈值。最后,我们展示模型性能与用于训练的合成数据集规模直接相关。

关键词

引用

@article{arxiv.2510.24670,
  title  = {Pearl: A Foundation Model for Placing Every Atom in the Right Location},
  author = {Genesis Research Team and Alejandro Dobles and Nina Jovic and Kenneth Leidal and Pranav Murugan and David C. Williams and Drausin Wulsin and Nate Gruver and Christina X. Ji and Korrawat Pruegsanusak and Gianluca Scarpellini and Ansh Sharma and Wojciech Swiderski and Andrea Bootsma and Richard Strong Bowen and Charlotte Chen and Jamin Chen and Marc André Dämgen and Benjamin DiFrancesco and J. D. Fishman and Alla Ivanova and Zach Kagin and David Li-Bland and Zuli Liu and Igor Morozov and Jeffrey Ouyang-Zhang and Frank C. Pickard and Kushal S. Shah and Ben Shor and Gabriel Monteiro da Silva and Roy Tal and Maxx Tessmer and Carl Tilbury and Cyr Vetcher and Daniel Zeng and Maruan Al-Shedivat and Aleksandra Faust and Evan N. Feinberg and Michael V. LeVine and Matteus Pan},
  journal= {arXiv preprint arXiv:2510.24670},
  year   = {2025}
}

备注

technical report