利用边界下面积排序识别错误标注数据
机器学习
2020-12-24 v4 计算机视觉与模式识别
机器学习
摘要
典型训练集中并非所有数据都有助于泛化;某些样本可能过度模糊或被彻底错误标注。本文提出一种新方法,用于在训练神经网络时识别此类样本并减轻其影响。我们算法的核心是位于边界下面积(AUM)统计量,它利用了干净样本与错误标注样本训练动态的差异。一个简单流程——添加一个由故意错误标注的阈值样本构成的额外类别——学习到一个隔离错误标注数据的 AUM 上界。该方法在合成与真实世界数据集上持续优于先前工作。在 WebVision50 分类任务中,我们的方法移除了 17% 的训练数据,使测试误差绝对降低 1.6%。在 CIFAR100 上移除 13% 的数据带来 1.2% 的误差下降。
引用
@article{arxiv.2001.10528,
title = {Identifying Mislabeled Data using the Area Under the Margin Ranking},
author = {Geoff Pleiss and Tianyi Zhang and Ethan R. Elenberg and Kilian Q. Weinberger},
journal= {arXiv preprint arXiv:2001.10528},
year = {2020}
}
备注
NeurIPS 2020