关于 ReDial 数据集对话式推荐系统标准化再评估
信息检索
2026-05-21 v2
摘要
近年来,针对对话式推荐系统(CRS)的研究呈快速增长。尽管存在多种数据集,ReDial 是最广泛使用的基准数据集,已被数百项研究引用。然而,数据集预处理方式及实验中 ground-truth 项目定义的差异,使得跨研究结果的比较困难。这些比较进一步受制于底层大语言模型(LLM)选择及外部数据源使用的影响。本文我们在标准化条件下重新评估七个突出 CRS 方法,覆盖三个架构家族。我们的可重复性研究揭示了“粒度差距”:细粒度排序(Recall@1)对实现细节高度敏感;而我们的可重复性分析表明,近 50% 的报告准确率源自“重复捷径”,此类捷径在以新颖性为导向的评估中并不存在。此外,我们发现性能提升往往更多归因于 LLM 背板的容量,而非特定架构创新。最后,通过应用用户中心的实用性指标,我们表明传统 Recall 指数常常高估系统实际对话效果。本工作建立透明、受控的基准,推动以新颖性和交互效率为导向的评估实践。
引用
@article{arxiv.2605.13053,
title = {A Standardized Re-evaluation of Conversational Recommender Systems on the ReDial Dataset},
author = {Ivica Kostric and Krisztian Balog},
journal= {arXiv preprint arXiv:2605.13053},
year = {2026}
}
备注
Accepted to Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia