ImmSET:面向TCR-pMHC特异性的序列型预测器
机器学习
2026-03-31 v1 定量方法
摘要
T 细胞是适应性免疫系统的关键组成部分,在感染性疾病、自身免疫病和癌症中发挥作用。T 细胞功能由T 细胞受体(TCR)蛋白介导,这是一种高度多样性的受体,靶向特定呈递于主要淋巴细胞异种抗原复合物(pMHC)的肽段。预测T 细胞受体对其特异性pMHC的识别是理解适应性免疫并实现个体化治疗的核心任务。然而,由于T 细胞和pMHC的极端多样性,准确预测这种蛋白-蛋白相互作用仍具有挑战。本文提出了ImmSET(Immune Synapse Encoding Transformer),一种新的基于序列的架构,旨在建模一组可变长度生物序列之间的相互作用。我们在不同数据规模和组成的集合上训练该模型,并研究所得模型对pMHC靶标的 generalization。我们描述了先前基于序列的方法中存在的一种失效模式,该模式会夸大此任务上此前报告的性能,而ImmSET 在更严格的评估下保持稳健。通过系统性测试 ImmSET 的数据规模行为,我们表明性能在数据量增长时保持一致,并与在相同数据集上进行微调的预训练蛋白语言模型ESM2相当。最后,我们展示了在提供足够训练数据的情况下,ImmSET 可以在TCR-pMHC特异性预测方面超越基于AlphaFold2和AlphaFold3的管道。这一工作确立了ImmSET 作为一种可扩展的建模范式,适用于需要高通量序列驱动推理的生物学问题,这些问题补充了结构预测和实验映射。
引用
@article{arxiv.2603.26994,
title = {ImmSET: Sequence-Based Predictor of TCR-pMHC Specificity at Scale},
author = {Marco Garcia Noceda and Matthew T Noakes and Andrew FigPope and Daniel E Mattox and Bryan Howie and Harlan Robins},
journal= {arXiv preprint arXiv:2603.26994},
year = {2026}
}
备注
Accepted to ML4H 2025 (Proceedings Track). To appear in PMLR 297