向预训练蛋白质模型注入构象的提示引导方法
人工智能
2022-02-08 v1 生物大分子
摘要
预训练蛋白质模型(PTPMs)以单一固定嵌入表示蛋白质,因此无法胜任多样任务。例如,蛋白质结构可在不同生物过程中于若干构象间发生偏移,即蛋白质折叠。为使 PTPMs 产生任务感知的表示,我们提出学习可解释、可插拔且可扩展的蛋白质提示,作为向 PTPMs 注入任务相关知识的方式。就此而言,先前以掩码语言建模任务优化 PTPM 可解释为学习序列提示(Seq prompt),使 PTPMs 捕获氨基酸间的序列依赖。为将构象知识整合进 PTPMs,我们提出通过蛋白质-蛋白质相互作用任务的反向传播学习的相互作用-构象提示(IC prompt)。作为实例,我们提出一种构象感知的预训练蛋白质模型,在多任务设定下同时学习序列与相互作用-构象提示。我们在九个蛋白质数据集上进行了综合实验。结果证实了我们的预期:使用序列提示不会损害 PTPMs 在序列相关任务上的性能,而融入相互作用-构象提示显著提升了 PTPMs 在构象知识起关键作用的任务上的性能。我们还展示了所学提示可组合并扩展以处理新的复杂任务。
引用
@article{arxiv.2202.02944,
title = {Prompt-Guided Injection of Conformation to Pre-trained Protein Model},
author = {Qiang Zhang and Zeyuan Wang and Yuqiang Han and Haoran Yu and Xurui Jin and Huajun Chen},
journal= {arXiv preprint arXiv:2202.02944},
year = {2022}
}
备注
Work in progress