中文

为何准确模型能从不准确的注释中学习?

机器学习 2025-05-23 v1

摘要

从不准确的注释中学习因获取精确标注成本高昂而引起了广泛关注。尽管存在错误标签,基于噪声数据训练的模型往往能够保持准确的预测能力。这一现象引出了一个根本性却鲜有人探讨的疑问:为何模型仍能从不准确的注释中提取正确标签信息 remains unexplored。本文我们对此issue进行全面调查。通过从经验和理论视角分析权重矩阵,我们发现标签不准确主要在较低奇异分量中积累噪声,并在细微扰动主特征子空间。处于一定范围内,基于不准确标签训练的权重主特征子空间与基于干净标签学习的权重主特征子空间基本对齐,保留了必要的任务相关信息。我们正式证明,在适度的标签不准确情况下,主特征子空间的夹角 exhibits minimal deviation,从而解释了为何模型仍能有效地泛化。基于这些见解,我们提出LIP(Lightweight Principal subspace preservation),一种轻量级插件,旨在帮助分类器保留主特征子空间信息,同时减轻标签不准确引起的噪声。针对各种不准确条件下的任务进行的大量实验表明,LIP在提升现有算法性能方面始终具有一致的优势。我们希望我们的发现能为理解在不准确监督下模型的鲁棒性提供有价值的理论和实践见解。

关键词

引用

@article{arxiv.2505.16159,
  title  = {Why Can Accurate Models Be Learned from Inaccurate Annotations?},
  author = {Chongjie Si and Yidan Cui and Fuchao Yang and Xiaokang Yang and Wei Shen},
  journal= {arXiv preprint arXiv:2505.16159},
  year   = {2025}
}