购物伴侣:用于长期偏好驱动电商任务的基准测试与 LLM 代理训练
计算与语言
2026-05-28 v3
摘要
在电子商务领域,LLM 代理在推荐、预算管理和捆绑销售等购物任务中显示出巨大的潜力,关键在于能够准确地从长期对话中捕捉用户偏好。然而,进展受到两个关键挑战的限制:(1)缺乏用于评估长期偏好感知购物任务的基准测试,以及(2)缺乏对购物代理训练的细粒度监督。为填补基准测试的空白,我们引入了购物伴侣基准测试(Shopping Companion Bench),一个包含两项需要跨会话偏好记忆的购物任务的新型基准测试,基于拥有超过 120 万件真实商品的商品库。我们进一步分析了该基准测试上的两个主要失败来源:由偏好幻觉引发的连锁错误,以及对产品属性未能充分验证用户需求。为解决这些失败模式,我们设计了无需注释的、工具级别的奖励机制,为每个工具调用提供过程级监督,从而缓解长期任务中的奖励稀疏问题。实验结果表明,即便是最先进的模型如 GPT-5,其成功率也低于 70%,凸显了本基准测试的难度。值得注意的是,我们的轻量级 4B 模型在偏好捕获和任务性能方面始终优于强大基线,表明我们的奖励设计有效。
引用
@article{arxiv.2603.14864,
title = {Shopping Companion: Benchmarking and Training LLM Agents for Long-Horizon Preference-Grounded E-Commerce Tasks},
author = {Zijian Yu and Kejun Xiao and Huaipeng Zhao and Tao Luo and Xiaoyi Zeng},
journal= {arXiv preprint arXiv:2603.14864},
year = {2026}
}