无需训练预测模型即可检测 corrupted 标签
机器学习
2022-06-22 v3
摘要
真实世界数据集中的标签噪声编码了错误的相关模式,并损害了深度神经网络(DNNs)的泛化能力。寻找高效的方法来检测 corrupted 模式至关重要。当前方法主要关注设计鲁棒的训练技术,以防止 DNNs 记忆 corrupted 模式。这些方法通常需要定制化的训练过程,并可能过拟合 corrupted 模式,导致检测性能下降。在本文中,从更以数据为中心的视角出发,我们提出了一种无需训练的解决方案来检测 corrupted 标签。直观上,“更接近”的实例更可能共享相同的干净标签。基于邻域信息,我们提出了两种方法:第一种通过检查附近特征的噪声标签一致性使用“局部投票”;第二种是一种基于排序的方法,对每个实例打分并过滤出保证数量的疑似 corrupted 实例。我们从理论上分析了特征质量如何影响局部投票,并提供了调整邻域大小的指导原则。我们还证明了基于排序方法的最坏情况误差界。在合成与真实世界标签噪声上的实验表明,我们的无需训练解决方案持续且显著地改进了大多数基于训练的基线方法。代码见 github.com/UCSC-REAL/SimiFeat。
引用
@article{arxiv.2110.06283,
title = {Detecting Corrupted Labels Without Training a Model to Predict},
author = {Zhaowei Zhu and Zihao Dong and Yang Liu},
journal= {arXiv preprint arXiv:2110.06283},
year = {2022}
}
备注
ICML 2022