SelectMix:通过针对性样本混合提升标签噪声鲁棒性
机器学习
2025-09-16 v1 计算机视觉与模式识别
机器学习
摘要
深度神经网络倾向于记忆带有噪声标签,从而严重降低其泛化性能。尽管 Mixup 在提高泛化和鲁棒性方面显示出有效性,但现有的 Mixup 类方法通常在样本选择和混合策略上缺乏原则性指导,导致噪声监督信号被不恰当地传递。为克服这些限制,我们提出 SelectMix,一个专为噪声标签设计的置信度引导混合框架。SelectMix 首先通过基于置信度的不匹配分析(使用 K 折交叉验证)识别可能含有噪声或模糊的样本,然后选择性地将这些不确定样本与来自其潜在类别中被预测得较为确定的样本进行混合。此外,SelectMix 使用来自混合过程中涉及的所有类别派生的软标签,确保标签准确地表示混合样本的组成,从而将监督信号与实际混合输入保持一致。通过对多个合成数据集(MNIST、Fashion-MNIST、CIFAR-10、CIFAR-100)和真实世界基准数据集(CIFAR-N、MNIST 和 Clothing1M)进行的广泛理论分析和实证评估表明,SelectMix 在处理噪声标签时始终优于强基线方法,验证了其有效性和鲁棒性。
引用
@article{arxiv.2509.11265,
title = {SelectMix: Enhancing Label Noise Robustness through Targeted Sample Mixing},
author = {Qiuhao Liu and Ling Li and Yao Lu and Qi Xuan and Zhaowei Zhu and Jiaheng Wei},
journal= {arXiv preprint arXiv:2509.11265},
year = {2025}
}