中文

RocketQA:一种用于开放域问答稠密段落检索的优化训练方法

计算与语言 2021-05-13 v2 信息检索

摘要

在开放域问答中,稠密段落检索已成为检索相关段落以寻找答案的新范式。通常采双编码器架构来学习问题与段落的稠密表示以进行语义匹配。然而,由于训练与推理间的差异、未标注正样本的存在以及训练数据有限等挑战,有效训练双编码器十分困难。为应对这些挑战,我们提出一种称为 RocketQA 的优化训练方法,以改进稠密段落检索。我们在 RocketQA 中作出三项主要技术贡献,即跨批次负样本、去噪难负样本与数据增强。实验结果表明,RocketQA 在 MSMARCO 和 Natural Questions 上均显著优于先前的最先进模型。我们还进行了大量实验以检验 RocketQA 中三种策略的有效性。此外,我们证明了基于我们的 RocketQA 检索器可提升端到端问答的性能。

关键词

引用

@article{arxiv.2010.08191,
  title  = {RocketQA: An Optimized Training Approach to Dense Passage Retrieval for Open-Domain Question Answering},
  author = {Yingqi Qu and Yuchen Ding and Jing Liu and Kai Liu and Ruiyang Ren and Wayne Xin Zhao and Daxiang Dong and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2010.08191},
  year   = {2021}
}

备注

NAACL 2021