中文

训练稠密段落检索器只需问题

计算与语言 2023-04-04 v4 信息检索

摘要

我们提出ART,一种用于训练稠密检索模型的新语料级自编码方法,不需要任何带标注的训练数据。稠密检索是开放域任务(如开放域问答(Open QA))的核心挑战,其最先进方法通常需要大型监督数据集,并配合定制的难负例挖掘与正例去噪。相比之下,ART仅需访问未配对输入与输出(例如问题与潜在答案文档)。它采用一种新的文档检索自编码方案:(1)用输入问题检索一组证据文档;(2)然后用这些文档计算重构原始问题的概率。基于问题重构的检索训练实现了文档编码器与问题编码器的有效无监督学习,二者随后可纳入完整的开放域问答系统而无需进一步微调。大量实验表明,ART仅依靠预训练语言模型的通用初始化,即在多个问答检索基准上取得最先进结果,消除了对标注数据与任务特定损失的需求。

关键词

引用

@article{arxiv.2206.10658,
  title  = {Questions Are All You Need to Train a Dense Passage Retriever},
  author = {Devendra Singh Sachan and Mike Lewis and Dani Yogatama and Luke Zettlemoyer and Joelle Pineau and Manzil Zaheer},
  journal= {arXiv preprint arXiv:2206.10658},
  year   = {2023}
}

备注

Accepted to TACL, pre MIT Press publication version