利用困难负样本优化稠密检索模型训练
信息检索
2021-04-19 v1
摘要
排序一直是信息检索研究中最受关注的问题之一。数十年来,词法匹配信号主导了即席检索过程,但检索中仅使用该信号可能导致词汇不匹配问题。近年来,随着表示学习技术的发展,许多研究者转向稠密检索(DR)模型以获得更好的排序性能。尽管若干现有DR模型已取得可喜结果,其性能提升严重依赖于训练样本的采样。许多有效的采样策略在实际使用中效率不足,且对大多数策略而言,仍缺乏关于性能提升如何及为何发生的理论分析。为阐明这些研究问题,我们从理论上考察DR模型的不同训练策略,并尝试解释为何困难负样本采样优于随机采样。通过的分析,我们还发现许多现有训练方法所采用的静态困难负样本采样存在诸多潜在风险。因此,我们分别提出两种训练策略:用于稠密检索的稳定训练算法(STAR)与直接优化排序性能的查询侧训练算法(ADORE)。STAR通过引入随机负样本提升了DR训练过程的稳定性。ADORE以动态困难负样本采样替换广泛采用的静态困难负样本采样方法,以直接优化排序性能。在两个公开可用检索基准数据集上的实验结果表明,两种策略均较现有竞争性基线获得显著提升,且二者结合可取得最佳性能。
引用
@article{arxiv.2104.08051,
title = {Optimizing Dense Retrieval Model Training with Hard Negatives},
author = {Jingtao Zhan and Jiaxin Mao and Yiqun Liu and Jiafeng Guo and Min Zhang and Shaoping Ma},
journal= {arXiv preprint arXiv:2104.08051},
year = {2021}
}
备注
To be published in SIGIR2021