利用蛋白质语言模型和泛化导向评估驱动精准致敏原预测
机器学习
2025-08-18 v1 定量方法
摘要
致敏原通常是能够触发免疫反应的蛋白质,代表着重大的公共卫生挑战。为了准确识别致敏原蛋白质,我们提出了Applm(Allergen Prediction with Protein Language Models,即基于蛋白质语言模型的致敏原预测),这是一套计算框架,利用1000亿参数的xTrimoPGLM蛋白质语言模型。我们表明,Applm在一系列贴近实际情景的任务中始终优于七种最先进的方法,包括识别缺乏类似训练集示例的新型致敏原、区分序列高度相似的致敏原和非致敏原、以及评估导致蛋白质序列仅少量变化的突变的功能后果。我们的分析确认,xTrimoPGLM原本是在一万亿个标记上训练的,以捕捉一般蛋白质序列特征,对于Applm的性能至关重要,通过检测蛋白质序列之间的重要差异。除提供Applm作为开源软件外,我们还提供了精心策划的基准数据集,以促进未来研究。
关键词
引用
@article{arxiv.2508.10541,
title = {Driving Accurate Allergen Prediction with Protein Language Models and Generalization-Focused Evaluation},
author = {Brian Shing-Hei Wong and Joshua Mincheol Kim and Sin-Hang Fung and Qing Xiong and Kelvin Fu-Kiu Ao and Junkang Wei and Ran Wang and Dan Michelle Wang and Jingying Zhou and Bo Feng and Alfred Sze-Lok Cheng and Kevin Y. Yip and Stephen Kwok-Wing Tsui and Qin Cao},
journal= {arXiv preprint arXiv:2508.10541},
year = {2025}
}
备注
59 pages, 5 main figures, 15 supplementary figures, 2 supplementary tables