中文

PAIR:利用以段落为中心的相似关系改进稠密段落检索

信息检索 2023-04-25 v2 人工智能 计算与语言

摘要

近年来,稠密段落检索已成为各类自然语言处理任务中寻找相关信息的主流方法。众多研究致力于改进被广泛采用的双编码器架构。然而,以往大多数研究在训练双编码器检索器时仅考虑以查询为中心的相似关系。为捕捉更全面的相似关系,我们提出一种新方法,利用以查询为中心与以段落为中心(PAssage-centric sImilarity Relations,简称 PAIR)的相似关系进行稠密段落检索。为实现该方法,我们作出三项主要技术贡献:引入两类相似关系的正式表述、通过知识蒸馏生成高质量伪标注数据,以及设计融合以段落为中心相似关系约束的有效两阶段训练流程。大量实验表明,我们的方法在 MSMARCO 与 Natural Questions 数据集上均显著优于以往的当前最优模型。

关键词

引用

@article{arxiv.2108.06027,
  title  = {PAIR: Leveraging Passage-Centric Similarity Relation for Improving Dense Passage Retrieval},
  author = {Ruiyang Ren and Shangwen Lv and Yingqi Qu and Jing Liu and Wayne Xin Zhao and QiaoQiao She and Hua Wu and Haifeng Wang and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2108.06027},
  year   = {2023}
}

备注

ACL 2021