中文

基于自适应阈值 Adaptive-k 的带标签噪声数据集鲁棒优化方法

机器学习 2022-03-29 v1 人工智能 计算机视觉与模式识别

摘要

SGD 在带有标签噪声的数据集上不能产生鲁棒的结果。因为根据噪声样本的损失所计算的梯度会使优化过程走向错误的方向。在本文中,作为 SGD 的替代方案,我们建议在优化过程中使用损失小于所确定阈值值的样本,而不是使用小批量中的所有样本。我们提出的方法 Adaptive-k 旨在将标签噪声样本排除在优化过程之外,并使过程鲁棒。在噪声数据集上,我们发现使用基于阈值的方法(如 Adaptive-k)比在小批量中使用所有样本或固定数量的低损失样本产生更好的结果。基于我们的理论分析和实验结果,我们表明 Adaptive-k 方法最接近 oracle 的性能,其中噪声样本被完全从数据集中移除。Adaptive-k 是一种简单但有效的方法。它不需要数据集噪声比的先验知识,不需要额外的模型训练,并且不会显著增加训练时间。Adaptive-k 的代码可在 https://github.com/enesdedeoglu-TR/Adaptive-k 获取。

关键词

引用

@article{arxiv.2203.14165,
  title  = {A Robust Optimization Method for Label Noisy Datasets Based on Adaptive Threshold: Adaptive-k},
  author = {Enes Dedeoglu and Himmet Toprak Kesgin and Mehmet Fatih Amasyali},
  journal= {arXiv preprint arXiv:2203.14165},
  year   = {2022}
}