用于因果TCR--pMHC结合推断的反事实肽编辑
机器学习
2026-04-16 v1 图形学
摘要
神经网络模型用于TCR-pMHC结合预测易受捷径学习影响:它们利用训练数据中的虚假关联——例如肽长度偏差或V族共现——而非物理结合界面。这使得预测在家族留置和距离感知评估下脆弱,因为此类捷径无法传递。我们引入反事实不变预测(Counterfactual Invariant Prediction, CIP),一种生成受生物学约束的反事实肽编辑并强制在非锚定位置保持不变性、放大MHC锚定残基敏感性的训练框架。CIP通过两种辅助目标增强基准分类器:(1)惩罚在保守的非锚定位代谢下的预测变化的不变性损失;(2)鼓励在锚定位 disruption 下产生大预测变化的对比损失。在覆盖VDJdb-IEDB基准数据集的家族留置、距离感知和随机划分下评估,CIP在具有挑战性的家族留置协议下实现了AUROC 0.831和反事实一致性(CFC)0.724,显著降低了相对于无约束基线的捷径指数降低39.7%。消融实验确认,锚定位感知的编辑生成是OFD gains的主要驱动力,为建立以因果为基础的TCR特异性建模提供了实用方法。
关键词
引用
@article{arxiv.2604.13256,
title = {Counterfactual Peptide Editing for Causal TCR--pMHC Binding Inference},
author = {Sanjar Khudoyberdiev and Arman Bekov},
journal= {arXiv preprint arXiv:2604.13256},
year = {2026}
}