中文

用户意图识别与对大语言模型的满意度:一项基于 ChatGPT 的用户研究

人机交互 2024-11-20 v2

摘要

LLM 的快速发展代表了数字交互与内容参与领域一次影响深远的范式转变。尽管它们编码了大量人类生成的知识,并在处理多样化数据类型方面表现出色,但往往面临准确响应特定用户意图的挑战,从而导致用户不满。基于细粒度的意图分类体系和基于意图的提示重构,我们分析了 GPT-3.5 Turbo 和 GPT-4 Turbo 模型对意图识别的质量以及用户对基于意图的提示重构所产生答案的满意度。我们的研究强调了人机交互的重要性,并强调了改进对话式 AI 系统需要跨学科方法。我们表明,GPT-4 在识别常见意图方面优于 GPT-3.5,但在识别低频意图方面往往不如 GPT-3.5。此外,每当用户意图被正确识别时,尽管用户对 GPT-4 基于意图的重构答案的满意度高于 GPT-3.5,但相比于重构后的提示,他们往往对模型针对原始提示给出的答案更为满意。我们研究中收集的数据已在 GitHub (https://github.com/ConcealedIDentity/UserIntentStudy) 上公开提供,以供进一步研究。

关键词

引用

@article{arxiv.2402.02136,
  title  = {User Intent Recognition and Satisfaction with Large Language Models: A User Study with ChatGPT},
  author = {Anna Bodonhelyi and Efe Bozkir and Shuo Yang and Enkelejda Kasneci and Gjergji Kasneci},
  journal= {arXiv preprint arXiv:2402.02136},
  year   = {2024}
}