ProtLLM:一种基于蛋白质-词预训练的交错式蛋白质语言大模型
生物大分子
2024-03-14 v1 人工智能
计算与语言
机器学习
摘要
我们提出 ProtLLM,一种 versatile cross-modal 大语言模型 (LLM),用于蛋白质中心任务和蛋白质语言任务。ProtLLM 具备独特的动态蛋白质挂载机制,使其能够处理自然语言文本中交错嵌入任意数量蛋白质的复杂输入。此外,我们提出蛋白质-词语言建模方法来训练 ProtLLM。通过开发专门的蛋白质词汇表,该模型具备从海量候选蛋白质中预测自然语言和蛋白质的能力。我们构建了大规模交错式蛋白质-文本数据集,命名为 InterPT,用于预训练。该数据集 comprehensively 包含 (1) 结构化数据源如蛋白质注释,以及 (2) 非结构化数据源如生物学研究论文,为 ProtLLM 提供理解蛋白质的关键知识。我们在经典监督蛋白质中心任务上评估 ProtLLM,并探索其新颖的蛋白质语言应用。实验结果表明,ProtLLM 在蛋白质中心任务上不仅在蛋白质专用基线上取得优异性能,还在蛋白质语言任务上诱导零样学习和 in-context 学习能力。
引用
@article{arxiv.2403.07920,
title = {ProtLLM: An Interleaved Protein-Language LLM with Protein-as-Word Pre-Training},
author = {Le Zhuo and Zewen Chi and Minghao Xu and Heyan Huang and Heqi Zheng and Conghui He and Xian-Ling Mao and Wentao Zhang},
journal= {arXiv preprint arXiv:2403.07920},
year = {2024}
}
备注
https://protllm.github.io/project/