中文

ProtTeX:基于大语言模型的蛋白质上下文结构推理与编辑

生物大分子 2025-03-14 v3 人工智能

摘要

大语言模型在分子科学领域取得了显著进展,特别是在理解和生成功能性小分子方面。这一成功很大程度上归功于分子标记化策略的有效性。在蛋白质科学中,氨基酸序列是大语言模型的唯一标记器。然而,蛋白质科学中的许多基本挑战本质上依赖于结构。缺乏结构感知标记显著限制了大语言模型进行全面生物分子理解和多模态生成的能力。为了解决这些挑战,我们引入了一个新框架 ProtTeX,它将蛋白质序列、结构和文本信息标记化为统一的离散空间。这种创新方法使得大语言模型能够通过下一标记预测范式进行联合训练,从而实现多模态蛋白质推理与生成。ProtTeX 使通用大语言模型能够通过顺序文本输入感知和处理蛋白质结构,将结构信息作为中间推理组件,并通过顺序文本输出生成或操控结构。实验表明,我们的模型在蛋白质功能预测方面取得了显著提升,以两倍的准确率超越了最先进的领域专家模型。我们的框架实现了高质量的构象生成和可定制的蛋白质设计。我们首次证明,通过采用大语言模型领域的标准训练和推理流程,ProtTeX 使仅解码器大语言模型能够有效应对多种蛋白质相关任务。

关键词

引用

@article{arxiv.2503.08179,
  title  = {ProtTeX: Structure-In-Context Reasoning and Editing of Proteins with Large Language Models},
  author = {Zicheng Ma and Chuanliu Fan and Zhicong Wang and Zhenyu Chen and Xiaohan Lin and Yanheng Li and Shihao Feng and Jun Zhang and Ziqiang Cao and Yi Qin Gao},
  journal= {arXiv preprint arXiv:2503.08179},
  year   = {2025}
}

备注

26 pages, 9 figures