中文

阐明多模态蛋白质语言模型的设计空间

机器学习 2025-06-13 v3 人工智能 定量方法

摘要

多模态蛋白质语言模型 (PLMs) 集成序列和基于标记的结构信息,为蛋白质建模、生成和设计提供了强大的基础。然而,依赖将 3D 结构标记化为离散标记会导致对细粒度结构细节和相关性的损失。在本文中,我们系统性地阐明了克服这些限制的多模态 PLMs 的设计空间。我们识别出标记化损失和 PLMs 对不准确结构标记预测作为主要瓶颈。为此,我们提出的设计空间涵盖改进的生成模型、结构感知架构和表示学习,以及数据探索。我们的进展方法接近更细粒度的监督,表明基于标记的多模态 PLMs 能够实现稳健的结构建模。有效的设计方法显著提高了结构生成的多样性,并在 PDB 测试集上将 RMSD 从 5.52 降至 2.36,甚至超过 3B 基准,基本等同于专门的折叠模型。项目页面和代码:https://bytedance.github.io/dplm/dplm-2.1/。

关键词

引用

@article{arxiv.2504.11454,
  title  = {Elucidating the Design Space of Multimodal Protein Language Models},
  author = {Cheng-Yen Hsieh and Xinyou Wang and Daiheng Zhang and Dongyu Xue and Fei Ye and Shujian Huang and Zaixiang Zheng and Quanquan Gu},
  journal= {arXiv preprint arXiv:2504.11454},
  year   = {2025}
}

备注

ICML 2025 Spotlight; Project Page: https://bytedance.github.io/dplm/dplm-2.1/