更多负样本在对比学习中必然有害吗?
机器学习
2022-06-24 v2 机器学习
摘要
近期关于噪声对比估计的研究在经验与理论上均表明,在对比损失中拥有更多“负样本”虽起初能提升下游分类性能,但超过某一阈值后,由于“碰撞-覆盖”权衡,它会损害下游性能。但这种现象是对比学习中固有的吗?我们在一个简单理论设定中表明,其中正样本对由底层隐类(由 Saunshi 等人 (ICML 2019) 引入)采样生成,优化(总体)对比损失所得表征的下游性能实际上并不随负样本数量增加而退化。在此过程中,我们给出了我们框架下噪声对比估计最优表征的结构性刻画。我们还在 CIFAR-10 与 CIFAR-100 数据集上提供了对理论结果的经验支持。
引用
@article{arxiv.2205.01789,
title = {Do More Negative Samples Necessarily Hurt in Contrastive Learning?},
author = {Pranjal Awasthi and Nishanth Dikkala and Pritish Kamath},
journal= {arXiv preprint arXiv:2205.01789},
year = {2022}
}
备注
16 pages