中文

更多负样本在对比学习中必然有害吗?

机器学习 2022-06-24 v2 机器学习

摘要

近期关于噪声对比估计的研究在经验与理论上均表明,在对比损失中拥有更多“负样本”虽起初能提升下游分类性能,但超过某一阈值后,由于“碰撞-覆盖”权衡,它会损害下游性能。但这种现象是对比学习中固有的吗?我们在一个简单理论设定中表明,其中正样本对由底层隐类(由 Saunshi 等人 (ICML 2019) 引入)采样生成,优化(总体)对比损失所得表征的下游性能实际上并不随负样本数量增加而退化。在此过程中,我们给出了我们框架下噪声对比估计最优表征的结构性刻画。我们还在 CIFAR-10 与 CIFAR-100 数据集上提供了对理论结果的经验支持。

关键词

引用

@article{arxiv.2205.01789,
  title  = {Do More Negative Samples Necessarily Hurt in Contrastive Learning?},
  author = {Pranjal Awasthi and Nishanth Dikkala and Pritish Kamath},
  journal= {arXiv preprint arXiv:2205.01789},
  year   = {2022}
}

备注

16 pages