中文

SamToNe:利用同塔负样本改进双编码器检索模型的对比损失

机器学习 2023-06-06 v1 信息检索

摘要

双编码器已被用于检索任务和表示学习,并取得了良好效果。训练双编码器的标准方法是使用带有批内负样本的对比损失。在这项工作中,我们通过将来自相同编码器塔的查询或文档添加到负样本中,提出了一种改进的对比学习目标,我们将其命名为“带有同塔负样本的对比损失”(SamToNe)。通过在MS MARCO和MultiReQA的问答检索基准以及异构零样本信息检索基准(BEIR)上进行评估,我们证明了SamToNe能有效提升对称和非对称双编码器的检索质量。通过t-SNE算法(van der Maaten and Hinton, 2008)直接探查两个编码塔的嵌入空间,我们观察到SamToNe确保了两个编码器塔嵌入空间之间的对齐。基于检索结果前11名的嵌入距离分布分析,我们进一步从正则化的角度解释了该方法的有效性。

关键词

引用

@article{arxiv.2306.02516,
  title  = {SamToNe: Improving Contrastive Loss for Dual Encoder Retrieval Models with Same Tower Negatives},
  author = {Fedor Moiseev and Gustavo Hernandez Abrego and Peter Dornbach and Imed Zitouni and Enrique Alfonseca and Zhe Dong},
  journal= {arXiv preprint arXiv:2306.02516},
  year   = {2023}
}

备注

ACL 2023 Findings