中文

利用大语言模型探讨对话式后续查询与用户满意度之间的相关性

人机交互 2024-07-19 v1 信息检索

摘要

随着大语言模型(LLM)的发展,对话式搜索引擎改变了用户从网上获取信息的方式,使其能够通过自然对话表达跨多轮的搜索意图。用户的自然对话蕴含着丰富但隐式的用户搜索意图及其对搜索结果满意度的评估信号,从而反映用户对系统体验的感知。然而,如何以及为何用户提出后续查询以继续与对话式搜索引擎互动,以及后续查询如何传递用户满意度信号,这些问题仍未得到充分探讨。本文基于对 Naver Cue: 这一商业对话式搜索引擎进行实验室用户评估中 250 轮对话的定性分析,提出了一种包含 18 种用户后续查询模式的分类框架,包含两个主要维度:(1)用户继续对话的动机(N=7);(2)后续查询的行为(N=11)。与现有查询改写文献相比,我们发现了一组新的动机与行为,包括请求主观意见或对引擎响应提供自然语言反馈。为便于对对话搜索日志进行可扩展且高效的分析,我们构建了一个基于LLM的分类器(准确率为73%)。运用该分类器,我们分析了来自 Cue: 真实使用日志中收集的 2,061 条对话元组,探讨了本文分类框架中的对话模式如何与用户满意度相关。我们的初步发现表明,某些不满意信号,如澄清查询、排除条件和替换条件,均可通过后续查询呈现。我们设想,这一方法可为自动评估对话搜索体验提供满意度信号,以及为实现真实用户情景模拟提供依据。

关键词

引用

@article{arxiv.2407.13166,
  title  = {Using LLMs to Investigate Correlations of Conversational Follow-up Queries with User Satisfaction},
  author = {Hyunwoo Kim and Yoonseo Choi and Taehyun Yang and Honggu Lee and Chaneon Park and Yongju Lee and Jin Young Kim and Juho Kim},
  journal= {arXiv preprint arXiv:2407.13166},
  year   = {2024}
}

备注

Accepted to LLM4Eval @ SIGIR 2024 - The First Workshop on Large Language Models (LLMs) for Evaluation in Information Retrieval