ShoppingComp:大语言模型是否已准备好为您的购物车做出决策?
计算与语言
2026-02-10 v2
摘要
我们提出 ShoppingComp,这是一个针对全面评估大语言模型驱动购物智能体的挑战性真实基准测试,涵盖三项核心能力:精准商品检索、专家级报告生成和安全关键决策。不同于先前的电商基准测试,ShoppingComp 引入困难的商品发现查询,包含众多约束条件,同时保证开放世界商品并实现智能体输出的易于验证。基准测试包含 145 个实例和 558 个情景,由 35 位专家精选,反映真实的购物需求。结果揭示了当前大语言模型的显著局限性:即使是最先进的模型也取得低成绩(例如 GPT-5.2 为 17.76%,Gemini-3-Pro 为 15.82%)。错误分析反映了核心智能体能力的局限性,包括开放世界环境中的信息 grounding、可靠验证多约束要求、对噪声和冲突证据的一致推理,以及风险意识决策。通过暴露这些能力缺口,ShoppingComp 刻画了人工智能系统在可被信赖地进行实际决策前必须跨越的信任阈值。我们的代码和数据集已公开于 https://github.com/ByteDance-BandAI/ShoppingComp。
关键词
引用
@article{arxiv.2511.22978,
title = {ShoppingComp: Are LLMs Really Ready for Your Shopping Cart?},
author = {Huaixiao Tou and Ying Zeng and Yuemeng Li and Cong Ma and Muzhi Li and Minghao Li and Weijie Yuan and He Zhang and Kai Jia},
journal= {arXiv preprint arXiv:2511.22978},
year = {2026}
}