中文

超越效用性:评估大语言模型作为推荐系统

信息检索 2024-11-04 v1

摘要

随着大型语言模型(LLM)的快速发展,近期研究将 LLM 作为推荐系统,以为不同用户提供个性化信息服务。尽管努力提高 LLM 基于推荐模型的准确性,但相对较少关注超出效用的维度。此外,LLM 基于推荐模型具有独特的评估方面,这些方面一直被大量忽视。为弥合这一差距,我们探索了四个新的评估维度并提出了一个多维度评估框架。新的评估维度包括:1)历史长度敏感性、2)候选位置偏差、3)生成涉及的性能、4)幻觉现象。所有四个维度都可能影响性能,但在传统系统中几乎不需要考虑。使用这个多维度评估框架,结合传统方面,我们评估了七个 LLM 基于推荐系统的性能,比较了三种提示策略与六个传统模型,在四个数据集上的排序和重新排序任务中进行比较。我们发现 LLM 在处理具有先验知识且输入历史较短的排序设置中表现出色,在重新排序设置中表现更好,跨越多个维度击败传统模型。然而,LLM 在处理候选位置偏差方面存在显著问题,某些模型比其他模型更频繁地产生幻觉式不存在的项目。我们意图我们的评估框架和观察结果有助于未来在 LLM 作为推荐系统方面的研究。代码和数据均可在 https://github.com/JiangDeccc/EvaLLMasRecommender 获取。

关键词

引用

@article{arxiv.2411.00331,
  title  = {Beyond Utility: Evaluating LLM as Recommender},
  author = {Chumeng Jiang and Jiayin Wang and Weizhi Ma and Charles L. A. Clarke and Shuai Wang and Chuhan Wu and Min Zhang},
  journal= {arXiv preprint arXiv:2411.00331},
  year   = {2024}
}