中文

缓解抗原数据瓶颈:用于甲型流感监测的蛋白质语言模型半监督学习

机器学习 2025-12-08 v1

摘要

甲型流感病毒(IAV)的抗原演化速度要求频繁更新疫苗,然而用于量化抗原性的血凝抑制(HI)试验劳动密集且难以扩展。因此,基因组数据远超可用的表型标签,限制了传统监督模型的效果。我们假设,将预训练的蛋白质语言模型(PLM)与半监督学习(SSL)结合,可以在标记数据稀缺时仍保持高预测准确率。我们评估了两种SSL策略——自训练(self-training)和标签传播(label spreading)——与完全监督基线进行对比,使用四种PLM导出的嵌入(ESM-2、ProtVec、ProtT5、ProtBert)应用于血凝素(HA)序列。嵌套交叉验证框架模拟了低标签场景(25%、50%、75%和100%标签可用性),涵盖四种IAV亚型(H1N1、H3N2、H5N1、H9N2)。SSL在标签稀缺时始终提升了性能。ProtVec上的自训练产生了最大的相对提升,表明SSL可以弥补较低分辨率表示的不足。ESM-2保持高度鲁棒性,在仅有25%标记数据时仍实现F1分数高于0.82,表明其嵌入捕获了关键抗原决定簇。虽然H1N1和H9N2的预测准确率高,但高变异的H3N2亚型仍具有挑战性,尽管SSL缓解了性能下降。这些发现表明,将PLM与SSL结合可以解决抗原性标记瓶颈,实现对未标记监测序列的更有效利用,支持快速变异株优先级排序和及时的疫苗株选择。

关键词

引用

@article{arxiv.2512.05222,
  title  = {Mitigating the Antigenic Data Bottleneck: Semi-supervised Learning with Protein Language Models for Influenza A Surveillance},
  author = {Yanhua Xu},
  journal= {arXiv preprint arXiv:2512.05222},
  year   = {2025}
}

备注

V0: initial draft uploaded