重新思考对话系统的评估:用户反馈对众包工人与 LLM 的影响
信息检索
2024-05-01 v2 计算与语言
摘要
在即时检索中,评估严重依赖于包括隐式反馈在内的用户行为。在对话场景中,由于交互的性质,此类信号通常不可用,相反,评估往往依赖于众包评估标签。在对话感知中,用户反馈对标注者轮次评估的作用鲜有研究。我们关注通过考虑被评估轮次的后续话语所提供的显式或隐式用户反馈,如何影响面向任务对话系统 (TDSs) 的评估。我们探索并比较了评估 TDSs 的两种方法:一种包含用户的后续话语,另一种不包含。我们使用众包工人和大型语言模型 (LLMs) 作为标注者,从相关性、有用性、趣味性和解释质量四个方面评估系统响应。研究结果表明,两组标注者在两种设置下给出的评分存在明显差异,表明用户反馈确实会影响系统评估。与 LLM 在趣味性和相关性方面相比,众包工人在有用性和趣味性方面更容易受用户反馈影响。用户反馈促使众包工人对有用性进行更个性化的评估,与用户的显式反馈紧密对齐。此外,在用户请求模糊或复杂的情况下,用户反馈提高了众包工人之间的一致性。这些发现强调了用户反馈在完善系统评估中的重要性,并建议在未来的研究中有可能实现自动化的反馈整合。我们公开发布了标注数据以促进该领域的研究。
引用
@article{arxiv.2404.12994,
title = {Rethinking the Evaluation of Dialogue Systems: Effects of User Feedback on Crowdworkers and LLMs},
author = {Clemencia Siro and Mohammad Aliannejadi and Maarten de Rijke},
journal= {arXiv preprint arXiv:2404.12994},
year = {2024}
}
备注
Accepted at SIGIR 2024 long paper track