关于对话式推荐系统用户中心评估的可靠性
信息检索
2026-02-20 v1
摘要
用户中心评估已成为评估对话式推荐系统(CRS)的关键范式,旨在捕捉满足感、可信度和关系等主观质量。为实现可扩展评估,近期工作越来越依赖第三方对静态对话日志的注释,由众包工作者或大语言模型完成。然而,这种做法的可靠性似乎未得到充分检视。在本文中,我们提出了一项大规模实证研究,探讨用户中心 CRS 评估在静态对话转录上的可靠性与结构。我们收集了 1,053 项来自 124 名众包工作者对 200 段 ReDial 对话的 18 维 CRS-Que 框架下的注释。通过随机效应可靠性模型和相关性分析,我们量化了各维度的稳定性及其相互依赖性。我们的结果显示,可实用性和结果导向的维度如准确性、有用性和满足感在聚合后实现中等可靠性,而基于社会的建构如人类感和关系则可靠性显著较低。此外,许多维度塌缩为单一的全局质量信号,揭示了第三方判断中强烈的光环效应。这些发现挑战了单注释者和 LLM 基于评估协议的有效性,动员多评者聚合和维度简化在离线 CRS 评估中发挥必要作用。
引用
@article{arxiv.2602.17264,
title = {On the Reliability of User-Centric Evaluation of Conversational Recommender Systems},
author = {Michael Müller and Amir Reza Mohammadi and Andreas Peintner and Beatriz Barroso Gstrein and Günther Specht and Eva Zangerle},
journal= {arXiv preprint arXiv:2602.17264},
year = {2026}
}
备注
5 pages, 2 figures. Submitted to UMAP 2026. Code available at https://github.com/michael-mue/reliable-crs-eval