Proteo-R1:面向二次构象设计的推理基础模型
机器学习
2026-05-06 v1 人工智能
计算工程、金融与科学
摘要
深度学习在二次构象设计中已实现原子级精度。然而,现有模型大多非推理性:直接合成分子几何,却未对哪些残基或相互作用在功能上至关重要进行显式推理。结果,设计决策与连续采样动力学 entangled,限制了可解释性、可控性以及生化知识的系统性复用。我们提出 **Proteo-R1**,一种推理引导的蛋白质设计框架,通过显式解耦 **分子理解** 与 **几何生成** 实现推理。Proteo-R1 采用双专家架构,其中多模态大语言模型(MLLM)作为 **理解专家**,分析蛋白质序列、结构与文本语境,识别控制结合性和特异性的关键功能残基。这些残基级决策作为硬约束传递给独立的扩散-based **生成专家**,后者在遵循固定相互作用锚点条件下进行条件共设计。这种分解方式模仿人类专家的分子工程方法:首先推理关键相互作用,再在这些约束下优化几何。通过将推理 operationalize 为显式残基级承诺而非潜在文本指引,Proteo-R1 实现了 LLM 推理与最新几何生成模型的稳定、可解释且模块化集成。代码、数据与演示已提供:https://smiles724.github.io/r1/。
引用
@article{arxiv.2605.02937,
title = {Proteo-R1: Reasoning Foundation Models for De Novo Protein Design},
author = {Fang Wu and Weihao Xuan and Heli Qi and Hanqun Cao and Heng-Jui Chang and Zeqi Zhou and Haokai Zhao and Ma Jian and Carl Ma and Yu-Chi Cheng and Kuan Pang and Xiangru Tang and Zehong Wang and Guanlue Li and Hanchen Wang and Kejun Ying and Pan Lu and Chiho Im and Seungju Han and Peng Xia and Tinson Xu and Yinxi Li and Deyao Zhu and Pheng-Ann Heng and Naoto Yokoya and Masashi Sugiyama and Li Erran Li and Jure Leskovec and Yejin Choi},
journal= {arXiv preprint arXiv:2605.02937},
year = {2026}
}