中文

利用边界下面积排序识别错误标注数据

机器学习 2020-12-24 v4 计算机视觉与模式识别 机器学习

摘要

典型训练集中并非所有数据都有助于泛化;某些样本可能过度模糊或被彻底错误标注。本文提出一种新方法,用于在训练神经网络时识别此类样本并减轻其影响。我们算法的核心是位于边界下面积(AUM)统计量,它利用了干净样本与错误标注样本训练动态的差异。一个简单流程——添加一个由故意错误标注的阈值样本构成的额外类别——学习到一个隔离错误标注数据的 AUM 上界。该方法在合成与真实世界数据集上持续优于先前工作。在 WebVision50 分类任务中,我们的方法移除了 17% 的训练数据,使测试误差绝对降低 1.6%。在 CIFAR100 上移除 13% 的数据带来 1.2% 的误差下降。

关键词

引用

@article{arxiv.2001.10528,
  title  = {Identifying Mislabeled Data using the Area Under the Margin Ranking},
  author = {Geoff Pleiss and Tianyi Zhang and Ethan R. Elenberg and Kilian Q. Weinberger},
  journal= {arXiv preprint arXiv:2001.10528},
  year   = {2020}
}

备注

NeurIPS 2020