中文

重访带噪标签学习:基于真实世界人类标注的研究

机器学习 2022-03-29 v2 机器学习

摘要

现有关于带噪标签学习的研究主要关注合成标签噪声。合成噪声虽具有清晰的结构从而极大便利了统计分析,却常无法建模真实世界的噪声模式。近期文献已观察到若干提供真实世界噪声数据集的努力,但现有努力存在两个缺陷:(1)缺乏真值验证,使得难以从理论上研究真实世界标签噪声的性质与处理方法;(2)这些努力通常规模较大,可能导致在合理且可获取的计算能力下鲁棒方法的不公平比较。为更好理解真实世界标签噪声,构建兼具真值与噪声标签、可控且中等规模的真实世界噪声数据集至关重要。本工作提出两个新基准数据集 CIFAR-10N、CIFAR-100N,为 CIFAR-10、CIFAR-100 的训练集配备了我们从 Amazon Mechanical Turk 收集的人类标注真实世界噪声标签。我们定量与定性地表明,真实世界噪声标签遵循实例依赖模式,而非经典假设与采用的模式(如类依赖标签噪声)。我们随后发起一项使用 CIFAR-10N 与 CIFAR-100N 对现有部分解法进行基准测试的努力。我们进一步研究对正确与错误预测的 memorization(记忆),这进一步说明了人类噪声与类依赖合成噪声之间的差异。我们表明,与合成标签噪声相比,真实世界噪声模式确实带来了崭新且严峻的挑战。这些观察要求我们重新思考噪声标签的处理,我们希望这两个数据集的可用性将促进未来带噪标签解法的开发与评估。数据集与排行榜见 http://noisylabels.com。

关键词

引用

@article{arxiv.2110.12088,
  title  = {Learning with Noisy Labels Revisited: A Study Using Real-World Human Annotations},
  author = {Jiaheng Wei and Zhaowei Zhu and Hao Cheng and Tongliang Liu and Gang Niu and Yang Liu},
  journal= {arXiv preprint arXiv:2110.12088},
  year   = {2022}
}

备注

Published as a conference paper at ICLR 2022