中文

xTrimoPGLM:用于破译蛋白质语言的统一千亿级预训练 Transformer

定量方法 2024-12-10 v2 人工智能 机器学习

摘要

蛋白质语言模型在从蛋白质序列中学习生物信息方面取得了显著成功。然而,现有大多数模型受限于自编码或自回归预训练目标,这使得它们难以同时处理蛋白质理解与生成任务。我们提出统一的蛋白质语言模型 xTrimoPGLM,通过创新的预训练框架同时应对这两类任务。我们的关键技术贡献在于探索了两种目标类型的兼容性及联合优化的潜力,从而形成了一种以空前的 1000 亿参数和 1 万亿训练词元规模训练 xTrimoPGLM 的策略。大量实验表明:1) xTrimoPGLM 在涵盖四个类别的 18 项蛋白质理解基准上显著优于其他先进基线。该模型还能提供蛋白质结构的原子级分辨率视图,催生了一个超越现有基于语言模型工具的先进三维结构预测模型。2) xTrimoPGLM 不仅能遵循天然蛋白质的原则生成全新蛋白质序列,还能在对精选序列进行监督微调后执行可编程生成。这些结果凸显了 xTrimoPGLM 在理解和生成蛋白质序列方面的强大能力与多功能性,为蛋白质科学领域基础模型的演进做出了贡献。

关键词

引用

@article{arxiv.2401.06199,
  title  = {xTrimoPGLM: Unified 100B-Scale Pre-trained Transformer for Deciphering the Language of Protein},
  author = {Bo Chen and Xingyi Cheng and Pan Li and Yangli-ao Geng and Jing Gong and Shen Li and Zhilei Bei and Xu Tan and Boyan Wang and Xin Zeng and Chiming Liu and Aohan Zeng and Yuxiao Dong and Jie Tang and Le Song},
  journal= {arXiv preprint arXiv:2401.06199},
  year   = {2024}
}

备注

100 pages with main text and supplementary contents