中文

面向实例依赖标签噪声的学习:一种样本筛方法

机器学习 2021-03-24 v2 机器学习

摘要

人工标注的标签常有噪声,此类噪声会降低所得深度神经网络(DNN)模型的性能。多数带噪标签学习的文献(少数近期工作除外)关注标签噪声独立于特征的情形。实践中,标注错误往往依赖于实例,并常取决于识别某任务的难度水平。将实例无关环境下的现有结果套用需大量估计噪声率。因此,为实例依赖标签噪声提供理论严谨的解仍是挑战。本文提出 CORES2^{2}(置信正则化样本筛,COnfidence REgularized Sample Sieve),渐进筛除损坏样本。CORES2^{2} 的实现无需指定噪声率,但我们仍能给出其在滤除损坏样本上的理论保证。该高质量样本筛使我们能在训练 DNN 解时分开处理干净样本与损坏样本,且这种分离在实例依赖噪声设定下被证明是有利的。我们在带合成实例依赖标签噪声的 CIFAR10 与 CIFAR100 数据集以及带真实人类噪声的 Clothing1M 上展示了 CORES2^{2} 的性能。作为独立兴趣点,我们的样本筛提供了剖析噪声数据集的通用机制,并为各类鲁棒训练技术提供灵活接口以进一步提升性能。代码见 https://github.com/UCSC-REAL/cores。

关键词

引用

@article{arxiv.2010.02347,
  title  = {Learning with Instance-Dependent Label Noise: A Sample Sieve Approach},
  author = {Hao Cheng and Zhaowei Zhu and Xingyu Li and Yifei Gong and Xing Sun and Yang Liu},
  journal= {arXiv preprint arXiv:2010.02347},
  year   = {2021}
}

备注

ICLR 2021