SamToNe:利用同塔负样本改进双编码器检索模型的对比损失
机器学习
2023-06-06 v1 信息检索
摘要
双编码器已被用于检索任务和表示学习,并取得了良好效果。训练双编码器的标准方法是使用带有批内负样本的对比损失。在这项工作中,我们通过将来自相同编码器塔的查询或文档添加到负样本中,提出了一种改进的对比学习目标,我们将其命名为“带有同塔负样本的对比损失”(SamToNe)。通过在MS MARCO和MultiReQA的问答检索基准以及异构零样本信息检索基准(BEIR)上进行评估,我们证明了SamToNe能有效提升对称和非对称双编码器的检索质量。通过t-SNE算法(van der Maaten and Hinton, 2008)直接探查两个编码塔的嵌入空间,我们观察到SamToNe确保了两个编码器塔嵌入空间之间的对齐。基于检索结果前名的嵌入距离分布分析,我们进一步从正则化的角度解释了该方法的有效性。
引用
@article{arxiv.2306.02516,
title = {SamToNe: Improving Contrastive Loss for Dual Encoder Retrieval Models with Same Tower Negatives},
author = {Fedor Moiseev and Gustavo Hernandez Abrego and Peter Dornbach and Imed Zitouni and Enrique Alfonseca and Zhe Dong},
journal= {arXiv preprint arXiv:2306.02516},
year = {2023}
}
备注
ACL 2023 Findings