基于难负样本的监督对比学习
机器学习
2024-05-13 v2
摘要
通过最小化诸如InfoNCE损失等适当的损失函数,对比学习(contrastive learning, CL)在嵌入空间中拉近正样本而推远负样本,从而学习有用的表示函数。正样本通常通过“保持标签”的增强方式创建,即给定数据或锚点的领域特定变换。在无类别信息时,无监督CL(unsupervised CL, UCL)中的负样本通常从整个数据集上预设的负采样分布中随机且独立于锚点选取。这导致UCL中的类别碰撞。监督CL(supervised CL, SCL)通过将负采样分布条件化为标签不同于锚点的样本,避免了此类类别碰撞。在难-UCL(hard-UCL, H-UCL)中,已证明是进一步增强UCL的有效方法,负采样分布通过硬化函数向更靠近锚点的样本条件倾斜。受此启发,本文提出难-SCL(hard-SCL, H-SCL),其中类条件负采样分布通过硬化函数倾斜。我们的模拟结果证实了H-SCL相对于SCL的效用,在下游分类任务中取得显著性能提升。在分析上,我们证明在每个锚点无限负样本极限及适当假设下,H-SCL损失由H-UCL损失上界所界,从而证明了在无标签信息时利用H-UCL控制H-SCL损失的效用。通过在多个数据集上的实验,我们验证了该假设以及H-UCL与H-SCL损失间所声称的不等式。我们还提供了一个H-SCL损失由UCL损失下界所界的合理情形,表明UCL在控制H-SCL损失方面效用有限。
引用
@article{arxiv.2209.00078,
title = {Supervised Contrastive Learning with Hard Negative Samples},
author = {Ruijie Jiang and Thuan Nguyen and Prakash Ishwar and Shuchin Aeron},
journal= {arXiv preprint arXiv:2209.00078},
year = {2024}
}