中文

无监督学习检索段落

计算与语言 2022-05-18 v2 信息检索

摘要

用于开放域问答(ODQA)的稠密检索器已通过在大规模问题—段落对数据集上训练而展现出令人印象深刻的性能。在本工作中,我们探究这种对标注数据的依赖能否通过面向 ODQA 的无监督预训练来降低。我们表明这事实上是可行的,通过一种为检索设计的新型预训练方案。我们的“循环跨度检索”方法利用文档中跨段落的循环跨度来创建对比学习的伪样本。我们的预训练方案直接控制伪查询与相关段落之间的词项重叠,从而能够对它们之间的词汇与语义关系进行建模。所得模型名为 Spider,在广泛 ODQA 数据集上无需任何标注训练样本即表现惊人地好。具体而言,它在零样本设定下显著优于所有其他预训练基线,并与强稀疏基线 BM25 具有竞争力。此外,基于 Spider 与 BM25 的混合检索器优于两者,且常能与在数万样本上训练的 DPR 模型相竞争。最后,当使用 Spider 作为有监督训练的初始化时观察到显著增益。

关键词

引用

@article{arxiv.2112.07708,
  title  = {Learning to Retrieve Passages without Supervision},
  author = {Ori Ram and Gal Shachaf and Omer Levy and Jonathan Berant and Amir Globerson},
  journal= {arXiv preprint arXiv:2112.07708},
  year   = {2022}
}

备注

NAACL 2022