中文

硬样本坏标签: 知道何时退让的鲁棒损失函数

机器学习 2025-11-27 v2

摘要

错误标记的训练数据在基准数据集和精心挑选的数据集中普遍存在。此类标记错误明显影响通过监督学习在所关联数据集上训练的模型性能和可推广性。检测标签错误的框架通常需要 well 训练的/well 泛化的模型; 然而, 大多数框架又依赖在恶意数据上训练这些模型, 这显然会降低模型的可推广性和随后的有效性——除非采用鲁棒于标签错误的训练方案。我们评估了两种新型损失函数, Blurry Loss 和 Piecewise-zero Loss, 通过对难以分类的样本进行减权或忽略来增强对标签错误的鲁棒性, 因为这些样本很可能是错误标记的。这些损失函数利用了误标记样本通常更难分类且应对学习信号贡献较少的思想。针对各种人为污染数据集进行全面实验, 表明提议的损失函数在几乎所有情况下都优于最先进的鲁棒损失函数, 在几乎所有情况下实现更好的 F1 分数以检测错误。通过消融研究进一步分析, 为确认这些损失函数对 uniform 和 non-uniform 损坏以及不同标签错误检测框架的广泛适用性提供了见解。通过使用这些鲁棒损失函数, 机器学习从业者可以更有效地识别、修剪或纠正其训练数据中的错误。

关键词

引用

@article{arxiv.2511.16512,
  title  = {Hard Samples, Bad Labels: Robust Loss Functions That Know When to Back Off},
  author = {Nicholas Pellegrino and David Szczecina and Paul Fieguth},
  journal= {arXiv preprint arXiv:2511.16512},
  year   = {2025}
}

备注

15 pages, 7 figures