简单、高效且可扩展的结构感知 Adapter 助推蛋白质语言模型
计算与语言
2024-04-24 v1 机器学习
生物大分子
摘要
微调预训练蛋白质语言模型(PLM)已成为增强下游预测任务的一种突出策略,其表现通常优于传统的监督学习方法。作为自然语言处理中广泛应用的强大技术,采用参数高效微调技术有可能提升 PLM 的性能。然而,由于训练策略和数据形式的不同,直接将其转移到生命科学任务并非易事。为了弥合这一差距,我们引入了 SES-Adapter,一种简单、高效且可扩展的 adapter 方法,用于增强 PLM 的表示学习。SES-Adapter 将 PLM 嵌入与结构序列嵌入相结合,以创建结构感知表示。我们表明,所提出的方法兼容不同的 PLM 架构并适用于多种任务。我们在具有显著质量差异的 2 种折叠结构、9 个 SOTA 基线和 9 个涵盖不同下游任务的基准数据集上进行了广泛评估。结果表明,与原始 PLM 相比,SES-Adapter 将下游任务性能最多提升了 11%,平均提升了 3%,同时训练速度显著加快,最高提升 1034%,平均提升 362%,收敛速度也提高了约 2 倍。此外,即使使用低质量的预测结构,也观察到了正向优化。SES-Adapter 的源代码可在 https://github.com/tyang816/SES-Adapter 获取。
引用
@article{arxiv.2404.14850,
title = {Simple, Efficient and Scalable Structure-aware Adapter Boosts Protein Language Models},
author = {Yang Tan and Mingchen Li and Bingxin Zhou and Bozitao Zhong and Lirong Zheng and Pan Tan and Ziyi Zhou and Huiqun Yu and Guisheng Fan and Liang Hong},
journal= {arXiv preprint arXiv:2404.14850},
year = {2024}
}
备注
30 pages, 4 figures, 8 tables