中文

一种用于免疫组库分类与疾病相关免疫受体序列识别的噪声标签学习形式化方法

机器学习 2023-08-01 v1

摘要

免疫组库分类是一个典型的多示例学习(MIL)问题,是计算生物学中的前沿研究课题,对新疫苗和免疫疗法具有变革性贡献。然而,传统的示例空间MIL将袋级标签直接分配给示例,受到海量噪声标签和极低见证率的困扰。在本工作中,我们提出一种噪声标签学习形式化方法以解决免疫组库分类任务。为弥补序列级分类器在组库级标签上的不准确监督,我们设计了一种鲁棒训练策略:初始标签被平滑为非对称形式,并在整个训练过程中利用模型预测逐步修正。此外,两个具有相同架构但不同参数初始化的模型同时协同训练,以弥补类自训练范式已知的“确认偏差”问题。由此,我们获得了准确的序列级分类,进而得到组库级分类。在巨细胞病毒(CMV)和癌症数据集上的实验证明了我们的方法在序列级和组库级任务上的有效性与优越性能。

关键词

引用

@article{arxiv.2307.15934,
  title  = {A Noisy-Label-Learning Formulation for Immune Repertoire Classification and Disease-Associated Immune Receptor Sequence Identification},
  author = {Mingcai Chen and Yu Zhao and Zhonghuang Wang and Bing He and Jianhua Yao},
  journal= {arXiv preprint arXiv:2307.15934},
  year   = {2023}
}

备注

IJCAI 2023