探索蛋白质语言模型架构诱导的偏见以实现抗体理解
机器学习
2025-12-11 v1
摘要
蛋白质语言模型(PLM)的最新进展展示了其在理解蛋白质序列方面的卓越能力。然而,不同模型架构在多大程度上能捕获抗体特有的生物学特性仍尚未被探索。在本工作中,我们系统地研究了 PLM 中的架构选择如何影响其理解抗体序列特征与功能的能力。我们在抗体靶点特异性预测任务上评估了三种最先进的 PLM——AntiBERTa、BioBERT 和 ESM2——并以通用语言模型(GPT-2)作为基线。我们的结果表明,尽管所有 PLM 均实现了高分类准确率,但它们在捕获 V 基因使用、体细胞超突变模式和同种型信息等生物学特征时表现出截然不同的偏见。通过注意力归因分析,我们表明像 AntiBERTa 这样的抗体特异性模型能自然地学会关注互补决定区(CDR),而通用蛋白质模型则从显式的 CDR 聚焦训练策略中显著受益。这些发现为模型架构与生物学特征提取之间的关系提供了见解,为未来计算抗体设计中的 PLM 开发提供了宝贵指导。
引用
@article{arxiv.2512.09894,
title = {Exploring Protein Language Model Architecture-Induced Biases for Antibody Comprehension},
author = {Mengren and Liu and Yixiang Zhang and Yiming and Zhang},
journal= {arXiv preprint arXiv:2512.09894},
year = {2025}
}