RecSys Arena:基于大语言模型的两两推荐系统评估
信息检索
2024-12-17 v1 人工智能
摘要
评估推荐系统的质量对于算法设计和优化至关重要。大多数评估方法基于离线指标计算,以实现算法的快速迭代,因为在线实验通常风险高且耗时。然而,离线评估通常无法完全反映用户对不同推荐算法结果的偏好,且结果可能与在线 A/B 测试不一致。此外,许多离线指标(如 AUC)无法提供充足的信息来比较两个具有竞争力的推荐系统在不同方面的细微差异,这可能导致长期在线服务中的巨大性能差异。幸运的是,得益于大语言模型(LLM)强大的常识知识和角色扮演能力,可以获得关于离线推荐结果的模拟用户反馈。受 LLM Chatbot Arena 的启发,本文提出了 RecSys Arena 的概念,在每次会话中由 LLM 裁判对两个不同推荐系统给出的推荐结果进行评估,以获得细粒度的评估反馈。更具体地说,对于每个样本,我们使用 LLM 根据用户行为历史或现成的画像特征生成用户画像描述,以此引导 LLM 扮演该用户的角色,并评估对不同模型生成的两个推荐结果的相对偏好。通过在不同场景下的两个推荐数据集上进行的大量实验,我们证明许多不同的 LLM 不仅提供了与标准离线指标高度一致的总体评估结果,还在许多主观方面提供了丰富的洞察。此外,在 AUC 和 nDCG 方面,它能更好地区分性能相当的算法。
引用
@article{arxiv.2412.11068,
title = {RecSys Arena: Pair-wise Recommender System Evaluation with Large Language Models},
author = {Zhuo Wu and Qinglin Jia and Chuhan Wu and Zhaocheng Du and Shuai Wang and Zan Wang and Zhenhua Dong},
journal= {arXiv preprint arXiv:2412.11068},
year = {2024}
}