中文

通过问题重写实现开放域问答的对话化

信息检索 2021-04-16 v3 计算与语言

摘要

我们引入了一个用于对话上下文中的问题重写(QReCC)的新数据集,其包含 14K 段对话与 80K 个问答对。QReCC 中的任务是在一个包含 10M 网页(切分为 54M 段落)的集合中查找对话问题的答案。同一对话中问题的答案可能分布在多个网页上。QReCC 提供的标注使我们能够训练和评估对话式端到端问答(QA)任务所需的子任务:问题重写、段落检索与阅读理解。我们报告了一种强基线方法的有效性,该方法结合了用于问题重写的 state-of-the-art 模型以及具有竞争力的开放域 QA 模型。我们的结果以 F1 为 19.10 为 QReCC 数据集设立了首个基线,而人类上限为 75.45,表明该设置具有难度且存在很大改进空间。

关键词

引用

@article{arxiv.2010.04898,
  title  = {Open-Domain Question Answering Goes Conversational via Question Rewriting},
  author = {Raviteja Anantha and Svitlana Vakulenko and Zhucheng Tu and Shayne Longpre and Stephen Pulman and Srinivas Chappidi},
  journal= {arXiv preprint arXiv:2010.04898},
  year   = {2021}
}

备注

15 pages, 10 tables, 3 figures, accepted at NAACL 2021