通过生成式预训练和测试时计算扩展原子级蛋白酶结合器设计
机器学习
2026-03-31 v1
摘要
蛋白质相互作用建模是蛋白酶设计的核心范畴,已被机器学习在药物发现等领域所变革。就此而言,基于结构的原初结合器设计被视为条件生成建模或通过结构预测器进行序列优化(即“幻觉”)。我们认为这是一种虚假的二分法,提出一种新的全原子级结合器生成方法 Proteina-Complexa,统一了两种范式。我们扩展了最近的基于流的潜在蛋白质生成架构,利用单体计算预测的蛋白质结构的域-域相互作用,构建了 Teddymer,这是一个新的大规模合成结合器-靶点对数据集,用于预训练。结合高质量的实验多聚体,这使我们能够训练强大的基础模型。随后,我们在此生成先验进行推理时优化,统一了此前各异生成和幻觉方法的优势。Proteina-Complexa 在计算结合器设计基准测试中取得了新的最佳成绩:它比现有生成方法在原子水平成功率上显著提高,我们的新型测试时优化策略在规范计算预算下显著优于以往的幻觉方法。我们还展示了界面氢键优化、基于折叠类的结合器生成,以及针对小分子靶点和酶设计任务的扩展,同样超过了先前的方法。代码、模型和新数据将公开发布。
引用
@article{arxiv.2603.27950,
title = {Scaling Atomistic Protein Binder Design with Generative Pretraining and Test-Time Compute},
author = {Kieran Didi and Zuobai Zhang and Guoqing Zhou and Danny Reidenbach and Zhonglin Cao and Sooyoung Cha and Tomas Geffner and Christian Dallago and Jian Tang and Michael M. Bronstein and Martin Steinegger and Emine Kucukbenli and Arash Vahdat and Karsten Kreis},
journal= {arXiv preprint arXiv:2603.27950},
year = {2026}
}
备注
ICLR 2026 Oral Presentation. Project page: https://research.nvidia.com/labs/genair/proteina-complexa/