中文

以通用代理模型进行样本选择来对抗标签噪声

计算机视觉与模式识别 2024-12-31 v2

摘要

现代深度学习系统渴求数据。利用网络数据学习是可行方案之一,但会不可避免地引入标签噪声,阻碍深度神经网络性能。样本选择是应对标签噪声的有效途径,其关键在于依据某种准则分离干净样本。以往方法更关注小损失准则,即将小损失样本视为干净样本。然而,该策略依赖于每个数据实例的学习动态,部分噪声样本因频繁出现的 corrupted 学习模式仍被记忆。为解决此问题,优选免训练的代理模型,以摆脱记忆效应影响。本工作中,我们提出利用视觉-语言代理模型CLIP自动过滤噪声样本。CLIP凭借其文本-图像对齐能力引入外部知识,助力干净样本选择。此外,设计了边缘自适应损失以正则化CLIP引入的选择偏置,提供对标签噪声的鲁棒性。我们在真实世界与合成噪声数据集上验证了所提方法的有效性。我们的方法在推理阶段无需涉及CLIP即取得显著提升。

关键词

引用

@article{arxiv.2310.10463,
  title  = {Combating Label Noise With A General Surrogate Model For Sample Selection},
  author = {Chao Liang and Linchao Zhu and Humphrey Shi and Yi Yang},
  journal= {arXiv preprint arXiv:2310.10463},
  year   = {2024}
}

备注

Accepted by IJCV 2024