中文

大型语言模型在推荐系统中的心理世界:关于联想、个性化与知识性的基准测试

信息检索 2025-12-22 v1

摘要

大型语言模型 (LLM) 通过作为知识增强器或零样本排序器在推荐系统 (RecSys) 中展现出潜力。关键挑战在于 LLM 与 RecSys 之间存在巨大的语义鸿沟——前者内化语言世界知识,后者捕获行为的个性化世界。不幸的是,研究社区缺乏全面基准来评估 LLM 在 RecSys 中局限性和边界,从而无法作出自信的结论。为此,我们提出名为 LRWorld 的基准,包含超过 38K 高质量样本和 2300 万 token,精心从广泛使用的公共推荐数据集中编译生成。LRWorld 将 LLM 在 RecSys 中的心理世界分为三个主要尺度(联想、个性化与知识性),由 10 个因素和 31 个衡量指标(任务)构成。基于 LRWorld,对众多 LLM 进行全面实验表明,它们在捕获深层神经网络个性化嵌入方面仍不够理想,但在浅层基于记忆的项目-项目相似性方面表现良好。此外,LLM 在推断用户兴趣时,擅长感知项目实体关系、实体层次分类学以及项目-项目关联规则。Furthermore,LLM 在多模态知识推理(电影海报和产品图片)方面展现出有前景的能力,并对噪声化用户档案具有鲁棒性。但在 10 个因素中均未表现出一致良好性能。我们对模型规模、位置偏差等进行了消除实验。

关键词

引用

@article{arxiv.2512.17389,
  title  = {The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability},
  author = {Guangneng Hu},
  journal= {arXiv preprint arXiv:2512.17389},
  year   = {2025}
}

备注

21 pages, 13 figures, 27 tables, submission to KDD 2025