Prot2Chat:面向蛋白质 Q&A 的早期融合文本、序列与结构的蛋白质大语言模型
机器学习
2025-05-23 v2 人工智能
生物大分子
摘要
动机:蛋白质在生命体中具有重要意义。然而,理解其功能面临诸多挑战,如多模态信息整合不足、训练参数数量大、基于分类的方法灵活性受限,以及缺乏针对蛋白质 Q&A 系统的系统性评估指标。为此,我们提出了Prot2Chat框架。结果:我们修改了 ProteinMPNN,通过统一的方式对蛋白质序列和结构信息进行编码。我们使用大语言模型(LLM)对问题进行向量编码,并开发了一个蛋白质-文本适配器,基于这些向量将蛋白质信息压缩为虚拟标记,实现文本和蛋白质信息的早期融合。最终,相同的 LLM 读取虚拟标记和问题以生成答案。为优化训练效率,我们冻结了编码器,并采用低秩适应(LoRA)技术对 LLM 进行微调。在两个数据集上的实验表明,无论是自动化指标还是专家评估,都显示出我们模型的卓越性能,零样本预测结果也凸显了其泛化能力。模型和代码均已公开于 https://github.com/wangzc1233/Prot2Chat。联系人:[email protected] 或 [email protected] 关键词:蛋白质 Q&A、早期融合、LLM
关键词
引用
@article{arxiv.2502.06846,
title = {Prot2Chat: Protein LLM with Early-Fusion of Text, Sequence and Structure},
author = {Zhicong Wang and Zicheng Ma and Ziqiang Cao and Changlong Zhou and Jun Zhang and Yiqin Gao},
journal= {arXiv preprint arXiv:2502.06846},
year = {2025}
}
备注
8 pages, 3 figures