中文

回溯:检索查询的成因

信息检索 2024-03-07 v1 计算与语言

摘要

许多在线内容门户允许用户提问以补充他们的理解(例如关于讲座)。虽然信息检索 (IR) 系统可以为这类用户查询提供答案,但它们无法直接帮助内容创作者(如希望改进内容的讲师)识别导致用户提出这些问题的片段。我们引入了“回溯”(backtracing) 任务,即系统检索最可能导致用户查询的文本片段。我们将回溯形式化为三个现实领域,这对于改善内容交付和沟通至关重要:(a) 讲座领域中理解学生困惑的成因,(b) 新闻文章领域中理解读者好奇心的成因,以及 (c) 对话领域中理解用户情绪的成因。我们评估了流行信息检索方法和语言建模方法(包括双编码器、重排序和基于似然的方法以及 ChatGPT)的零样本性能。虽然传统 IR 系统检索语义相关的信息(例如,针对查询“多次投影是否仍导致同一点?”提供关于“投影矩阵”的详细信息),但它们经常遗漏因果相关的上下文(例如,讲师陈述“投影两次得到的答案与一次投影相同”)。我们的结果表明,回溯方面仍有改进空间,需要新的检索方法。我们希望我们的基准能促进未来用于回溯的检索系统的改进,催生能够优化内容生成并识别影响用户查询的语言触发器的系统。我们的代码和数据已开源:https://github.com/rosewang2008/backtracing。

关键词

引用

@article{arxiv.2403.03956,
  title  = {Backtracing: Retrieving the Cause of the Query},
  author = {Rose E. Wang and Pawan Wirawarn and Omar Khattab and Noah Goodman and Dorottya Demszky},
  journal= {arXiv preprint arXiv:2403.03956},
  year   = {2024}
}

备注

Code: https://github.com/rosewang2008/backtracing; EACL 2024 Findings, Long Paper