中文

面向大规模文档集合问答中文档与片段联合排序的神经模型

信息检索 2021-06-17 v1 机器学习

摘要

面向大规模文档集合的问答(QA)系统通常采用如下流水线:检索可能相关的文档、对文档重排序、对排名靠前文档的段落或其他片段排序,以及从排名靠前的片段中选取跨度作为精确答案。流水线在概念上简单,但错误会从某一组件传播至下一组件,且后续组件无法修正先前的决策。我们提出了一种用于文档与片段联合排序(即中间两个阶段)的架构,其利用了相关文档含有优质片段、而优质片段来自相关文档的直觉。该架构具有通用性,可与任意神经文本相关性排序器配合使用。我们基于 POSIT-DRMM(PDRMM)和基于 BERT 的排序器,对该架构进行了两种主要实例化实验。在 BIOASQ 生物医学数据上的实验表明,我们的联合模型在片段检索(QA 的主要目标)上大幅优于流水线,且可训练参数更少,同时在文档检索上仍具竞争力。此外,尽管使用的参数少几个数量级,我们基于 PDRMM 的联合模型仍可与基于 BERT 的模型相媲美。这些结论也得到了 BIOASQ 两个测试批次人工评估的支持。为在另一数据集上验证关键发现,我们修改了 Natural Questions 数据集,使其也可用于文档与片段检索。在修改后的 Natural Questions 数据集上,我们基于 PDRMM 的联合模型再次在片段检索上优于相应流水线,尽管其在文档检索上表现不如流水线。我们公开了代码与修改后的 Natural Questions 数据集。

关键词

引用

@article{arxiv.2106.08908,
  title  = {A Neural Model for Joint Document and Snippet Ranking in Question Answering for Large Document Collections},
  author = {Dimitris Pappas and Ion Androutsopoulos},
  journal= {arXiv preprint arXiv:2106.08908},
  year   = {2021}
}

备注

12 pages, 3 figures, 4 tables, ACL-IJCNLP 2021