结构增强蛋白指令调优:通向通用蛋白理解的 LLM 方法
计算与语言
2025-05-30 v3 生物大分子
摘要
蛋白质作为必需的生物分子,在生物过程中发挥核心作用,包括代谢反应和 DNA 复制。准确预测其性质和功能在生物应用中至关重要。最近发展出的蛋白语言模型(pLMs)通过监督微调提供了可行方案。然而,微调后的模型针对特定的下游预测任务设计,如何实现通用蛋白理解仍是挑战。本文引入结构增强蛋白指令调优(SEPIT)框架以弥合这一差距。我们的方法将新颖的结构感知模块嵌入 pLMs 以丰富其结构知识,随后将这些增强后的 pLMs 与大语言模型(LLMs)集成,以提升蛋白质理解。在该框架中,我们提出了新颖的指令调优管线。首先,我们采用对比学习和结构去噪对增强后的 pLMs 进行预热。随后,使用标题化指令建立蛋白质的基本理解。最后,通过采用混合专家(MoE)技术,以相同数量的激活参数捕获更复杂的性质和功能信息。此外,我们构建了目前最大且最全面的蛋白指令数据集,使我们能够训练和评估通用蛋白理解模型。在开放式生成和封闭集回答任务上的大量实验表明,SEPIT 在闭源通用 LLM 和使用蛋白知识训练的开源 LLM 方面表现优异。
引用
@article{arxiv.2410.03553,
title = {Structure-Enhanced Protein Instruction Tuning: Towards General-Purpose Protein Understanding with LLMs},
author = {Wei Wu and Chao Wang and Liyi Chen and Mingze Yin and Yiheng Zhu and Kun Fu and Jieping Ye and Hui Xiong and Zheng Wang},
journal= {arXiv preprint arXiv:2410.03553},
year = {2025}
}
备注
Accepted by KDD2025