中文

为新兴领域一夜构建可解释且可靠的开放信息检索器

计算与语言 2023-08-10 v1 信息检索

摘要

信息检索(IR)或知识检索,是开放域问答(QA)等许多下游任务的关键组件。它也极具挑战性,因为它要求简洁性、完整性与正确性。在近期工作中,稠密检索模型通过将查询与知识段落表示为稠密向量并学习词法与语义相似性,在域内IR与QA基准上取得了最先进(SOTA)性能。然而,使用单一稠密向量与端到端监督并非总是最优,因为查询可能需要关注多个方面乃至隐式知识。在本工作中,我们提出一种信息检索流水线,使用实体/事件链接模型与查询分解模型,以更准确地聚焦于查询的不同信息单元。我们表明,在更具可解释性与可靠性的同时,我们所提出的流水线在五个IR与QA基准上显著提升了段落覆盖率与指称准确率。由于其卓越的可解释性与跨域性能,它将成为在新兴领域执行IR且无需大量专门投入的应用的首选系统。

关键词

引用

@article{arxiv.2308.04756,
  title  = {Building Interpretable and Reliable Open Information Retriever for New Domains Overnight},
  author = {Xiaodong Yu and Ben Zhou and Dan Roth},
  journal= {arXiv preprint arXiv:2308.04756},
  year   = {2023}
}

备注

Submission of ACL 2023. Rejected