中文

对比表示学习中负样本作用的研究

机器学习 2021-06-21 v1 计算与语言 机器学习

摘要

噪声对比学习是一种流行的无监督表示学习技术。在该方法中,表示通过归约为监督学习获得,其中给定语义相似性概念,学习器试图从一组随机(负)样本中区分出相似(正)样本。现代对比学习流程的成功依赖于许多参数,例如数据增强的选择、负样本数量以及批大小;然而,对于这些参数如何相互作用并影响下游性能的理解十分有限。我们聚焦于厘清其中一个参数的作用:负样本数量。理论上,我们展示了碰撞-覆盖权衡(collision-coverage trade-off)的存在,表明最优负样本数量应随数据中潜在概念的数量而缩放。在经验上,我们仔细考察了负样本数量在自然语言处理(NLP)与视觉任务中的作用。在NLP任务中,我们发现结果大体与我们的理论一致,而我们的视觉实验则较为模糊,性能有时甚至对负样本数量不敏感。我们讨论了造成此行为的合理原因,并建议未来方向以更好地对齐理论与实践。

关键词

引用

@article{arxiv.2106.09943,
  title  = {Investigating the Role of Negatives in Contrastive Representation Learning},
  author = {Jordan T. Ash and Surbhi Goel and Akshay Krishnamurthy and Dipendra Misra},
  journal= {arXiv preprint arXiv:2106.09943},
  year   = {2021}
}