面向对话式推荐系统的当前评估实践的局限性以及用户仿真潜力的探讨
信息检索
2025-10-08 v1
摘要
对话式推荐系统(CRSs)的研究与开发严重依赖可靠且有效的评估方法论。然而,由于这些系统的交互性质,自动评估面临重大挑战。本文批判性地检视了当前评估实践,识别出两个关键局限性:对静态测试集合的过度依赖,以及现有评估指标的不足。为论实论证,我们分析了与九个现有CRSs的真实用户交互,展示了自我报告的用户满意度与先前文献中报告的性能分数之间的显著脱节。为解决这些局限性,本文探索了用户仿真以生成动态交互数据的潜力,为静态数据集提供了一种不同路径。此外,我们提出了基于通用奖励/成本框架的新型评估指标,以更好地与真实用户满意度保持一致。我们对不同仿真方法的分析提供了其有效性和可行性的宝贵见解,并显示出与人类评估相比,系统排名相关性得到改善的鼎鼎初步成果。尽管这些发现表明CRs评估有一个重大的进步,但我们也确定了仿真技术和评估指标在未来研究和完善方面的领域。
引用
@article{arxiv.2510.05624,
title = {Limitations of Current Evaluation Practices for Conversational Recommender Systems and the Potential of User Simulation},
author = {Nolwenn Bernard and Krisztian Balog},
journal= {arXiv preprint arXiv:2510.05624},
year = {2025}
}
备注
Proceedings of the 2025 Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region (SIGIR-AP 2025), December 7--10, 2025, Xi'an, China