利用对比置信度正则化缓解密集检索中假阴性的影响
计算与语言
2024-01-17 v2
摘要
在开放域问答中,密集检索对于找到相关段落以生成答案至关重要。通常,对比学习用于训练检索模型,将段落和查询映射到同一语义空间。目标是使相似的更接近,不相似的更远离。然而,由于假阴性问题(数据标注中可能遗漏相关段落),训练这样的系统具有挑战性。硬负采样(常用于改进对比学习)可能会在训练中引入更多噪声,因为硬负样本更接近给定查询,因此更可能是假阴性。为了解决这个问题,我们提出了一种新颖的对比置信度正则化器,用于噪声对比估计(NCE)损失(密集检索中常用的损失)。我们的分析表明,该正则化器有助于密集检索模型在理论上保证对假阴性更具鲁棒性。此外,我们提出了一种模型无关的方法来过滤数据集中的噪声负样本,从而改进任何下游密集检索模型。通过在三个数据集上的实验,我们证明了我们的方法相比现有最先进的密集检索系统取得了更好的检索性能。
引用
@article{arxiv.2401.00165,
title = {Mitigating the Impact of False Negatives in Dense Retrieval with Contrastive Confidence Regularization},
author = {Shiqi Wang and Yeqin Zhang and Cam-Tu Nguyen},
journal= {arXiv preprint arXiv:2401.00165},
year = {2024}
}
备注
Accepted by AAAI24