中文

NORMY:面向开放检索对话式问答的非均匀历史建模

信息检索 2024-02-08 v1

摘要

开放检索对话式问答(OrConvQA)以对话作为上下文,并从文档集合中检索以回答问题。典型的 OrConvQA 流水线由三个模块组成:用于从集合中检索相关文档的检索器,用于在给定问题和上下文的情况下对文档进行重排的重排器,以及用于提取答案跨度的阅读器。对话轮次可以为回答最终查询提供有价值的上下文。最先进的 OrConvQA 系统在流水线的所有三个模块中使用相同的历史建模。我们假设这是次优的。具体而言,我们认为在流水线的早期模块中需要更宽泛的上下文以免遗漏相关文档,而在后期模块中则需要更窄的上下文以识别确切的答案跨度。我们提出了 NORMY,这是首个无监督的非均匀历史建模流水线,它为每个模块生成最佳对话历史。我们进一步为 NORMY 提出了一种新颖的检索器,它对对话历史进行关键短语提取,并利用先前轮次中检索到的段落作为额外上下文。我们还通过扩展 doc2dial 数据集,为 OrConvQA 创建了一个新数据集。我们实现了各种最先进的历史建模技术,并在三个数据集(OR-QUAC、我们的 doc2dial 扩展和 ConvMix)上针对流水线的每个模块分别进行了全面评估。我们的大量实验表明,NORMY 在单个模块和端到端系统中均优于现有最先进技术。

关键词

引用

@article{arxiv.2402.04548,
  title  = {NORMY: Non-Uniform History Modeling for Open Retrieval Conversational Question Answering},
  author = {Muhammad Shihab Rashid and Jannat Ara Meem and Vagelis Hristidis},
  journal= {arXiv preprint arXiv:2402.04548},
  year   = {2024}
}

备注

Accepted for publication at IEEE ICSC 2024