中文

基于大语言模型的可解释对话系统用户满意度估计

信息检索 2024-06-11 v2 人工智能

摘要

准确且可解释的用户满意度估计(USE)对于理解、评估和持续改进对话系统至关重要。用户在通用型(如 ChatGPT 和 Bing Copilot)和任务导向型(如客服聊天机器人)对话系统中,通过多样化的对话模式表达其满意或不满意。现有基于特征化机器学习模型或文本嵌入的方法难以提取可泛化的模式,且难以解释。本工作中,我们展示了大语言模型(LLM)能够比基于嵌入的方法更有效地从用户的自然语言话语中提取可解释的满意度信号。此外,可以通过一个使用标注样本监督的迭代提示框架,为 USE 定制 LLM。由此产生的方法,即监督式提示用户满意度评分细则(SPUR),不仅具有更高的准确性,而且更可解释,因为它通过带有详细分解的学习评分细则来对用户满意度进行评分。

关键词

引用

@article{arxiv.2403.12388,
  title  = {Interpretable User Satisfaction Estimation for Conversational Systems with Large Language Models},
  author = {Ying-Chun Lin and Jennifer Neville and Jack W. Stokes and Longqi Yang and Tara Safavi and Mengting Wan and Scott Counts and Siddharth Suri and Reid Andersen and Xiaofeng Xu and Deepak Gupta and Sujay Kumar Jauhar and Xia Song and Georg Buscher and Saurabh Tiwary and Brent Hecht and Jaime Teevan},
  journal= {arXiv preprint arXiv:2403.12388},
  year   = {2024}
}