中文

理解与缓解监督对比学习中的人工标注错误

计算机视觉与模式识别 2024-03-12 v1 人工智能 机器学习

摘要

人工标注的视觉数据集不可避免地包含一部分人工误标的样本。尽管此类误标对监督学习的不利影响已被充分研究,但它们对监督对比学习(Supervised Contrastive Learning, SCL)的影响在很大程度上仍未被探索。在本文中,我们表明人工标注错误不仅与合成标签错误显著不同,而且在SCL中构成了独特的挑战,有别于传统监督学习方法中的挑战。具体而言,我们的结果表明,当它们作为假阳性样本出现时,在约99%的情况下会对学习过程产生不利影响。现有的降噪方法主要关注合成标签错误,并处理极高合成噪声率(40-80%)的不切实际设定,但由于过拟合,它们在常见图像数据集上通常表现不佳。为了解决这个问题,我们引入了一种对人工标注错误具有鲁棒性的新型SCL目标函数,即SCL-RHE。SCL-RHE旨在缓解现实世界误标样本的影响,这些样本通常具有低得多的噪声率(<5%)。我们证明,通过增强对人工标注错误的抵御能力,SCL-RHE在各种视觉基准测试中始终优于最先进的表示学习和降噪方法。

关键词

引用

@article{arxiv.2403.06289,
  title  = {Understanding and Mitigating Human-Labelling Errors in Supervised Contrastive Learning},
  author = {Zijun Long and Lipeng Zhuang and George Killick and Richard McCreadie and Gerardo Aragon Camarasa and Paul Henderson},
  journal= {arXiv preprint arXiv:2403.06289},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2311.16481