INN:一种基于深度神经网络一致性效应识别干净标注样本的方法
机器学习
2021-06-30 v1 机器学习
摘要
在许多分类问题中,收集大量干净标注数据并不容易,因此已有大量研究致力于处理带噪声标签的数据。近期针对噪声标签问题的最先进解决方案大多建立在利用记忆效应的小损失策略之上。尽管这是一个强有力的工具,记忆效应仍存在若干缺陷。其性能对利用记忆效应所需训练轮次的选择十分敏感。此外,当标签被严重污染或不平衡时,记忆效应可能不会出现,此时基于小损失策略的方法无法识别干净标注数据。我们提出一种称为INN(与最近邻的集成,Integration with the Nearest Neighborhoods)的新方法,以从带噪声标签的训练数据中精炼出干净标注数据。所提方法基于一个新发现:无论训练轮次如何,干净标注数据邻域内的预测模式始终与噪声标注数据不同。INN方法需要更多计算,但比小损失策略更稳定且更强大。通过多种实验,我们证明INN方法成功解决了记忆效应中的不足,从而有助于利用带噪声标签的训练数据构建更精确的深度预测模型。
引用
@article{arxiv.2106.15185,
title = {INN: A Method Identifying Clean-annotated Samples via Consistency Effect in Deep Neural Networks},
author = {Dongha Kim and Yongchan Choi and Kunwoong Kim and Yongdai Kim},
journal= {arXiv preprint arXiv:2106.15185},
year = {2021}
}
备注
17 pages, 9 figures