中文

缓解含噪标签学习中样本选择的过拟合记忆

机器学习 2021-07-16 v1

摘要

由于深度学习易受噪声标签影响,仅用干净标注数据训练网络的样本选择技术已引起广泛关注。然而,若标签主要被少数类别污染,这些噪声样本称为主导噪声标签样本,网络也会通过内容感知优化快速学习主导噪声标签样本。本研究中,我们提出一种有力准则,通过类级惩罚标签来重度惩罚主导噪声标签样本。通过对每个观测标签的预测置信度取平均,我们得到合适的惩罚标签:若标签被某些类别大幅污染,则其值较高。使用基准数据集(CIFAR-10、CIFAR-100、Tiny-ImageNet)和真实世界数据集(ANIMAL-10N、Clothing1M)在不同噪声率的各种场景下评估所提准则。使用所提样本选择,相比现有方法,网络的学习过程在多种噪声类型下对噪声标签显著更鲁棒。

关键词

引用

@article{arxiv.2107.07041,
  title  = {Mitigating Memorization in Sample Selection for Learning with Noisy Labels},
  author = {Kyeongbo Kong and Junggi Lee and Youngchul Kwak and Young-Rae Cho and Seong-Eun Kim and Woo-Jin Song},
  journal= {arXiv preprint arXiv:2107.07041},
  year   = {2021}
}

备注

14 pages, 9 figures, spotlight presented at the ICML 2021 Workshop on Subset Selection in ML