中文

面向开放检索问答的合成目标域监督

计算与语言 2022-04-21 v1 信息检索

摘要

神经段落检索是开放检索问答中一种新颖且有前景的方法。本工作中,我们在 COVID-19 等封闭且专门的目标域上压力测试了稠密段落检索器(DPR)——一种最先进(SOTA)的开放域神经检索模型——发现在此重要现实设定下其落后于标准 BM25。为使 DPR 在域偏移下更鲁棒,我们探索使用合成训练样本对其进行微调,这些样本由文本到文本生成器从未标注目标域文本生成。在我们的实验中,这种有噪声但全自动的目标域监督使 DPR 在域外设定下相较 BM25 获得可观优势,使其在实践中成为更可行的模型。最后,BM25 与我们改进 DPR 模型的集成取得了最佳结果,进一步推动了多个域外测试集上开放检索问答的 SOTA。

关键词

引用

@article{arxiv.2204.09248,
  title  = {Synthetic Target Domain Supervision for Open Retrieval QA},
  author = {Revanth Gangi Reddy and Bhavani Iyer and Md Arafat Sultan and Rong Zhang and Avirup Sil and Vittorio Castelli and Radu Florian and Salim Roukos},
  journal= {arXiv preprint arXiv:2204.09248},
  year   = {2022}
}

备注

Published at SIGIR 2021