面向图像分类的鲁棒即时数据集去噪方法
机器学习
2020-04-10 v2 计算机视觉与模式识别
图像与视频处理
摘要
在存在错误标注样本的情况下,过参数化神经网络中的记忆效应会严重损害泛化能力。然而,在弱监督收集的超大规模数据集中,错误标注样本难以避免。我们通过反事实推理来解决此问题:考虑带有均匀随机标签的样本若与真实样本一起训练时的损失分布,并利用该信息从训练集中移除含噪样本。首先,我们观察到在大学习率下使用随机梯度下降训练时,带有均匀随机标签的样本具有更高的损失。接着,我们提出仅利用网络参数对反事实样本的损失分布进行建模,该模型能以显著的成功率刻画此类样本。最后,我们提出移除损失超过所建损失分布某一分位数的样本。这催生了即时数据去噪(ODD),一种简单而有效的算法,其对错误标注样本具有鲁棒性,同时与标准训练相比几乎不引入额外计算开销。ODD 能够在包括 WebVision 和 Clothing1M 等真实世界数据集的广泛数据集上取得最先进的(SOTA)结果。
引用
@article{arxiv.2003.10647,
title = {Robust and On-the-fly Dataset Denoising for Image Classification},
author = {Jiaming Song and Lunjia Hu and Michael Auli and Yann Dauphin and Tengyu Ma},
journal= {arXiv preprint arXiv:2003.10647},
year = {2020}
}