重新思考 InfoNCE:你需要多少负样本?
机器学习
2021-05-28 v1 信息检索
摘要
InfoNCE 损失是对比模型训练中广泛使用的损失函数。它旨在通过区分每个正样本对及其关联的 个负样本对来估计一对变量之间的互信息。已有证明表明,当样本标签干净时,纳入更多负样本会使互信息估计的下界更紧,通常带来更好的模型性能。然而,在许多真实世界任务中标签常含噪声,为模型训练纳入过多带噪负样本可能并非最优。本文通过半定量理论框架研究在不同场景下 InfoNCE 需要多少负样本为最优。更具体地,我们首先提出一个概率模型来分析负采样比例 对训练样本信息量的影响。然后,我们设计了一个训练有效性函数,基于样本信息量来衡量训练样本对模型学习的整体影响。我们利用使训练有效性函数最大化的 值来估计最优负采样比例。基于我们的框架,我们进一步提出了一种自适应负采样方法,可动态调整负采样比例以改进基于 InfoNCE 的模型训练。在不同真实世界数据集上的大量实验表明,我们的框架能准确预测不同任务中的最优负采样比例,且我们提出的自适应负采样方法比常用的固定负采样比例策略取得更好性能。
引用
@article{arxiv.2105.13003,
title = {Rethinking InfoNCE: How Many Negative Samples Do You Need?},
author = {Chuhan Wu and Fangzhao Wu and Yongfeng Huang},
journal= {arXiv preprint arXiv:2105.13003},
year = {2021}
}