中文

CTRL:基于训练损失聚类的标签错误检测

机器学习 2023-09-14 v2

摘要

在监督式机器学习中,使用正确标签对于确保高准确率极为重要。遗憾的是,大多数数据集含有损坏的标签。在此类数据集上训练的机器学习模型泛化能力不佳。因此,检测其标签错误可显著提升其效用。我们提出一种新颖的框架,称为 CTRL(Clustering TRaining Losses for label error detection,用于标签错误检测的训练损失聚类),以检测多类数据集中的标签错误。它基于模型以不同方式学习干净与含噪标签这一观察,分两步检测标签错误。首先,我们使用含噪训练数据集训练神经网络,并获得每个样本的损失曲线。然后,我们对训练损失应用聚类算法,将样本分为两类:干净标注与含噪标注。标签错误检测后,我们移除含噪标签样本并重新训练模型。我们的实验结果表明,在模拟噪声下的图像(CIFAR-10 和 CIFAR-100)与表格数据集上均达到了最先进的错误检测准确率。我们还通过理论分析深入阐释了 CTRL 表现优异的原因。

关键词

引用

@article{arxiv.2208.08464,
  title  = {CTRL: Clustering Training Losses for Label Error Detection},
  author = {Chang Yue and Niraj K. Jha},
  journal= {arXiv preprint arXiv:2208.08464},
  year   = {2023}
}