无偏有监督对比学习
机器学习
2023-05-05 v4 计算机视觉与模式识别
机器学习
摘要
许多数据集存在偏差,即它们包含易于学习的特征,这些特征仅在数据集中与目标类别高度相关,而在数据的真实潜在分布中并非如此。因此,从有偏数据中学习无偏模型近年来已成为一个非常相关的研究课题。在本工作中,我们致力于学习对偏差具有鲁棒性的表示。我们首先提出了一个基于间隔的理论框架,使我们能够阐明为何近期的对比损失(InfoNCE、SupCon等)在处理有偏数据时会失效。基于此,我们推导出有监督对比损失的一种新形式(epsilon-SupInfoNCE),对正样本与负样本之间的最小距离提供更精确的控制。此外,得益于我们的理论框架,我们还提出了FairKL,一种新的去偏差正则化损失,即使在极端有偏数据上也能良好工作。我们在包括CIFAR10、CIFAR100和ImageNet的标准视觉数据集上验证了所提损失,并评估了FairKL结合epsilon-SupInfoNCE的去偏差能力,在多个有偏数据集(包括现实世界中真实存在的偏差实例)上达到了SOTA性能。
引用
@article{arxiv.2211.05568,
title = {Unbiased Supervised Contrastive Learning},
author = {Carlo Alberto Barbano and Benoit Dufumier and Enzo Tartaglione and Marco Grangetto and Pietro Gori},
journal= {arXiv preprint arXiv:2211.05568},
year = {2023}
}
备注
Accepted at ICLR 2023 (v3); Fix typo in Eq.19 (v4)