评估 ChatGPT 作为推荐系统:一种严谨方法
信息检索
2024-06-05 v2 人工智能
计算与语言
摘要
大语言模型(LLMs)近期在处理各类自然语言相关任务中展现出令人印象深刻的的能力。在不同 LLM 中,现有研究已评估了 ChatGPT 在多种任务上的优越性能,尤其在零样本/少样本提示条件下。鉴于此类成功,推荐系统(RSs)研究界已开始探究其在推荐场景中的潜在应用。然而,尽管已提出多种方法将 ChatGPT 的能力整合进 RSs,当前研究在考虑生成式模型特性的同时难以全面评估此类模型。通常,评估未考虑幻觉、重复和域外推荐,且仅关注准确性指标,忽视了超出准确性方面的影响。为弥补这一差距,我们提出了一种鲁棒评估流程,以评估 ChatGPT 作为 RS 的能力,并对 ChatGPT 推荐进行后处理以考量这些方面。通过该流程,我们采用角色扮演提示在零样本条件下考察了 ChatGPT-3.5 和 ChatGPT-4 在推荐任务中的性能。我们在三种设置下分析了模型的功能:Top-N 推荐、冷启动推荐和推荐列表重排序,以及三个领域:电影、音乐和书籍。实验揭示 ChatGPT 在书籍领域表现出高于基线的准确性。它还在重排序和冷启动场景中表现出色,同时保持合理的超出准确性指标。此外,我们度量了 ChatGPT 推荐与其他推荐器之间的相似性,从而提供关于 ChatGPT 在推荐系统领域中如何归类的见解。该评估流程已公开发布以供未来研究。
引用
@article{arxiv.2309.03613,
title = {Evaluating ChatGPT as a Recommender System: A Rigorous Approach},
author = {Dario Di Palma and Giovanni Maria Biancofiore and Vito Walter Anelli and Fedelucio Narducci and Tommaso Di Noia and Eugenio Di Sciascio},
journal= {arXiv preprint arXiv:2309.03613},
year = {2024}
}