通过互近邻增强稠密检索方法的排序上下文
信息检索
2023-10-24 v2
摘要
稀疏标注对训练稠密检索模型提出了持续性挑战;例如,当未标注的相关文档被误用作对比学习中的负例时,会扭曲训练信号。为缓解该问题,我们引入基于证据的标签平滑——一种新颖且计算高效的方法,可避免模型因对假负例赋予高相关性而受惩罚。为计算给定查询排序上下文中候选文档的目标相关性分布,我们基于候选文档与真实文档的相似程度,对那些与真实文档最相似的候选赋予非零相关性概率。为估计相关性,我们利用了基于互近邻的改进相似度度量,该度量亦可独立用于后处理中的候选重排序。通过在两个大规模临时文本检索数据集上的大量实验,我们证明互近邻既能用于标签平滑,也能用于重排序,从而提升稠密检索模型的排序效果。这表明,通过考虑文档与查询间超出简单几何距离的关系,我们可有效增强排序上下文。
引用
@article{arxiv.2305.15720,
title = {Enhancing the Ranking Context of Dense Retrieval Methods through Reciprocal Nearest Neighbors},
author = {George Zerveas and Navid Rekabsaz and Carsten Eickhoff},
journal= {arXiv preprint arXiv:2305.15720},
year = {2023}
}
备注
EMNLP 2023