中文

迈向填补对话式搜索的空白:从段落检索到对话式回复生成

信息检索 2023-08-21 v1

摘要

迄今关于对话式搜索的研究大多聚焦于查询重写与多阶段段落检索。然而,将检索到的最优段落综合为完整、相关且简洁的回复仍是一项开放挑战。若能对相关段落进行片段级标注,则将同时实现:(1) 训练能够基于实际陈述生成答案的回复生成模型;(2) 从完整性角度自动评估所生成回复。本文针对 TREC 对话式辅助 track 的两个数据集,解决收集高质量片段级答案标注的问题。为保障质量,我们首先开展初步标注研究,采用不同任务设计、众包平台及不同资质的工作人员。基于该研究结论,我们在进行全面数据收集前完善了标注协议。总体而言,我们为 1.8k 个问答段落对收集了标注,每对由三名独立众包工作者标注。如此规模的数据收集过程也带来了关于该问题的多重见解,可为指导未来回复生成方法的设计提供依据。本文为 CIKM'23 会议同名文章的扩展版。

关键词

引用

@article{arxiv.2308.08911,
  title  = {Towards Filling the Gap in Conversational Search: From Passage Retrieval to Conversational Response Generation},
  author = {Weronika Łajewska and Krisztian Balog},
  journal= {arXiv preprint arXiv:2308.08911},
  year   = {2023}
}

备注

Extended version of the paper that appeared in the Proceedings of the 32nd ACM International Conference on Information and Knowledge Management (CIKM '23)