中文

面向数据净化的组效益实例选择

机器学习 2024-03-26 v1 多媒体

摘要

手动标注用于训练深度模型的数据集非常耗费人力和时间。为了克服这一缺点,直接利用网络图像作为训练数据成为自然选择。然而,网络数据中标签噪声的存在通常会降低模型性能。现有的对抗标签噪声的方法通常是在合成噪声数据集上设计和测试的。然而,它们在真实世界的噪声数据集上往往无法取得令人满意的结果。为此,我们提出了一种名为GRIP的方法来缓解合成和真实世界数据集中的噪声标签问题。具体来说,GRIP利用一种组正则化策略,估计类别软标签以提高噪声鲁棒性。软标签监督减少了对噪声标签的过拟合,并学习了类间相似性以利于分类。此外,实例净化操作通过测量每个训练样本与其类别软标签之间的差异来全局识别噪声标签。通过组级和实例级的操作,我们的方法集成了噪声鲁棒和噪声清洗方法的优点,显著减轻了噪声标签导致的性能下降。在合成和真实世界数据集上的综合实验结果表明,GRIP优于现有的最先进方法。

关键词

引用

@article{arxiv.2403.15694,
  title  = {Group Benefits Instances Selection for Data Purification},
  author = {Zhenhuang Cai and Chuanyi Zhang and Dan Huang and Yuanbo Chen and Xiuyun Guan and Yazhou Yao},
  journal= {arXiv preprint arXiv:2403.15694},
  year   = {2024}
}

备注

accepted by IEEE Intelligent Systems