探索大语言模型在推荐系统中实现惊喜度评估潜力
信息检索
2025-07-24 v1
摘要
惊喜度在提升推荐系统用户满意度方面发挥着关键作用,但其评估因内在的主观性和概念模糊性而面临重大挑战。当前的算法方法主要依赖代理指标进行间接评估,往往无法与真实用户的感知相吻合,从而存在鸿沟。随着大语言模型(LLM)在各类人类标注任务中的评估方法论日益革新,我们灵感启发于:大语言模型能否有效模拟人类用户进行惊喜度评估?为回答此问题,本文基于电子商务和电影领域来自真实用户研究得出的两个数据集开展元评估,聚焦三个关键方面:大语言模型相对于常规代理指标的准确性、辅助数据对大语言模型理解的影响,以及最近流行的多语言模型技术的有效性。我们的发现表明,最简单的零样本大语言模型已达到或超越常规指标的性能。此外,多语言模型技术以及辅助数据的加入进一步提升了与人类视角的对齐程度。基于我们的研究发现,大语言模型的最优评估结果与用户研究结果之间的皮尔逊相关系数为21.5%。本研究表明,大语言模型可能作为潜在的准确且成本效益高的评估者,为推荐系统中的惊喜度评估引入新范式。
引用
@article{arxiv.2507.17290,
title = {Exploring the Potential of LLMs for Serendipity Evaluation in Recommender Systems},
author = {Li Kang and Yuhan Zhao and Li Chen},
journal= {arXiv preprint arXiv:2507.17290},
year = {2025}
}
备注
RecSys2025