弥合语言与物品以进行检索和推荐:评估作为语义编码器的大语言模型
信息检索
2026-04-21 v2
摘要
特征工程长期以来一直是推荐系统的核心,但有效利用文本物品特征仍然具有挑战性。大语言模型 (LLM) 的最新进展使其能够作为推荐系统的语义编码器,但它们在此设置中的角色和行为仍未被充分理解。先前的研究在选择 LLM 时通常依赖通用嵌入基准(如 MTEB),忽视了推荐任务的独特特征。为了填补这一空白,我们引入了 BLaIR,这是一个用于评估 LLM 作为推荐场景中语义编码器的综合基准。我们贡献了:(1) 一个新的包含超过 5.7 亿条评论和 4800 万个物品的大规模 Amazon Reviews 2023 数据集;(2) 一个涵盖序列推荐、协同过滤和产品搜索的统一基准;(3) 一个新的复杂查询产品搜索任务,包含半合成和真实世界的评估数据集。对 11 个领先 LLM 的实验表明,它们在 BLaIR 上的排名与 MTEB 相关性很低,突显了推荐中语义编码的独特挑战。
引用
@article{arxiv.2403.03952,
title = {Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders},
author = {Yupeng Hou and Jiacheng Li and Xiangjun Fu and Zhankui He and An Yan and Xiusi Chen and Julian McAuley},
journal= {arXiv preprint arXiv:2403.03952},
year = {2026}
}
备注
ACL 2026