面向任意模态蛋白生成的大规模多模态模型 HelixProtX
机器学习
2024-07-15 v1 人工智能
生物大分子
摘要
蛋白质是生物系统的基本组成部分,可通过多种模态表示,包括序列、结构和文本描述。尽管深度学习和科学大型语言模型(LLM)在蛋白质研究方面取得了进展,当前方法主要聚焦于有限的专门任务——常常只预测一种蛋白质模态从另一种。这些方法限制了对多模态蛋白质数据的理解与生成。相比之下,大规模多模态模型在生成任意内容(如文本、图像和视频)方面展现出潜在能力,丰富了用户在各个领域的交互方式。将这些多模态模型技术集成到蛋白质研究中,为潜在地改变蛋白质研究方式提供了显著的希望。为此,我们引入 HelixProtX,一个建立在大规模多模态模型之上的系统,旨在通过支持任意蛋白质模态的生成,为蛋白质研究提供全面解决方案。与现有方法不同,HelixProtX 允许将任意输入蛋白质模态转换为任意所需的蛋白质模态。实验结果确认了 HelixProtX 的先进能力,不仅在从氨基酸序列生成功能描述方面表现出色,还在从文本描述设计蛋白质序列和结构方面完成关键任务。初步发现表明,HelixProtX 在蛋白质相关任务中始终能实现优异的准确率,超越现有最先进模型。通过将多模态大模型集成到蛋白质研究中,HelixProtX 为理解蛋白质生物学开辟了新途径,为加速科学发现进程承诺巨大潜力。
引用
@article{arxiv.2407.09274,
title = {Unifying Sequences, Structures, and Descriptions for Any-to-Any Protein Generation with the Large Multimodal Model HelixProtX},
author = {Zhiyuan Chen and Tianhao Chen and Chenggang Xie and Yang Xue and Xiaonan Zhang and Jingbo Zhou and Xiaomin Fang},
journal= {arXiv preprint arXiv:2407.09274},
year = {2024}
}