面向稠密文本检索的对抗式检索器-排序器
计算与语言
2022-11-01 v5
摘要
当前稠密文本检索模型面临两个典型挑战。首先,它们采用孪生双编码器架构独立编码查询与文档以实现快速索引与搜索,却忽略了更细粒度的词项级交互,导致召回性能次优。其次,其模型训练高度依赖负采样技术,在对比损失中构建负文档。为应对这些挑战,我们提出对抗式检索器-排序器(Adversarial Retriever-Ranker, AR2),其由一个双编码器检索器与一个交叉编码器排序器组成。两个模型依据极小极大对抗目标联合优化:检索器学习检索负文档以欺骗排序器,而排序器学习对包含真实文档与检索文档的候选集合进行排序,并向双编码器检索器提供渐进式直接反馈。通过该对抗博弈,检索器逐步生成更难的负文档以训练更优的排序器,而交叉编码器排序器提供渐进式反馈以改进检索器。我们在三个基准上评估 AR2。实验结果表明,AR2 持续且显著优于现有稠密检索方法,并在所有基准上取得新的 SOTA 结果,包括 Natural Questions 的 R@5 提升至 77.9%(+2.1%)、TriviaQA 的 R@5 提升至 78.2%(+1.4)以及 MS-MARCO 的 MRR@10 提升至 39.5%(+1.3%)。代码与模型见 https://github.com/microsoft/AR2。
引用
@article{arxiv.2110.03611,
title = {Adversarial Retriever-Ranker for dense text retrieval},
author = {Hang Zhang and Yeyun Gong and Yelong Shen and Jiancheng Lv and Nan Duan and Weizhu Chen},
journal= {arXiv preprint arXiv:2110.03611},
year = {2022}
}
备注
ICLR 2022