以通用代理模型进行样本选择来对抗标签噪声
计算机视觉与模式识别
2024-12-31 v2
摘要
现代深度学习系统渴求数据。利用网络数据学习是可行方案之一,但会不可避免地引入标签噪声,阻碍深度神经网络性能。样本选择是应对标签噪声的有效途径,其关键在于依据某种准则分离干净样本。以往方法更关注小损失准则,即将小损失样本视为干净样本。然而,该策略依赖于每个数据实例的学习动态,部分噪声样本因频繁出现的 corrupted 学习模式仍被记忆。为解决此问题,优选免训练的代理模型,以摆脱记忆效应影响。本工作中,我们提出利用视觉-语言代理模型CLIP自动过滤噪声样本。CLIP凭借其文本-图像对齐能力引入外部知识,助力干净样本选择。此外,设计了边缘自适应损失以正则化CLIP引入的选择偏置,提供对标签噪声的鲁棒性。我们在真实世界与合成噪声数据集上验证了所提方法的有效性。我们的方法在推理阶段无需涉及CLIP即取得显著提升。
引用
@article{arxiv.2310.10463,
title = {Combating Label Noise With A General Surrogate Model For Sample Selection},
author = {Chao Liang and Linchao Zhu and Humphrey Shi and Yi Yang},
journal= {arXiv preprint arXiv:2310.10463},
year = {2024}
}
备注
Accepted by IJCV 2024