中文

面向开放域对话式搜索中用户满意度的深入理解

信息检索 2024-01-25 v2

摘要

随着对话式搜索的日益普及,如何评估对话式搜索系统的性能已成为信息检索(IR)界的一个重要问题。现有关于对话式搜索评估的工作主要可分为两类:(1) 基于语义相似度构建指标(如 BLEU、METEOR 与 BERTScore),或 (2) 使用传统搜索方法(如 nDCG、RBP 与 nERR)直接评估系统的回复排序性能。然而,这些方法要么忽略用户的信息需求,要么忽略对话式搜索的混合主动属性。这引出了如何准确建模对话式搜索场景中用户满意度的问题。由于显式要求用户提供满意度反馈较为困难,传统 IR 研究常依赖 Cranfield 范式(即第三方标注)与用户行为建模来估计搜索中的用户满意度。然而,这两种方法在对话式搜索中的可行性与有效性尚未被充分探索。本文从用户满意度视角深入探究对话式搜索的评估。我们搭建了一个新颖的对话式搜索实验平台,并构建了一个包含丰富标注与搜索行为数据的汉语开放域对话式搜索行为数据集。我们还收集了会话级与轮次级第三方满意度标注,以考察 Cranfield 范式在对话式搜索场景中的可行性。实验结果显示用户满意度标注与第三方标注之间既存在一定一致性,也存在相当差异。我们还提出了对话续接或结束行为模型(DCEBM),基于轮次级信息捕捉会话级用户满意度。

关键词

引用

@article{arxiv.2204.02659,
  title  = {Towards Better Understanding of User Satisfaction in Open-Domain Conversational Search},
  author = {Zhumin Chu and Qingyao Ai and Zhihong Wang and Yiqun Liu and Yingye Huang and Rui Zhang and Min Zhang and Shaoping Ma},
  journal= {arXiv preprint arXiv:2204.02659},
  year   = {2024}
}

备注

25 pages