中文

WebMall——一个用于评估 Web 智能体的多店铺基准

计算与语言 2026-05-01 v3

摘要

基于 LLM 的 Web 智能体有潜力自动化执行长时间运行的 Web 任务,例如在多个电子商店中搜索产品,并随后订购满足用户需求的最便宜产品。用于评估 Web 智能体的基准要么要求智能体使用实时 Web 在线执行任务,要么使用模拟环境离线执行,后者允许精确复现实验设置。虽然 DeepShop 和 ShoppingComp 提供了要求智能体执行挑战性购物任务的在线基准,但现有的离线基准,如 WebShop、WebArena 和 Mind2Web,仅涵盖针对包含单一来源产品数据的单个店铺执行的相对简单的电子商务任务。目前缺少的是一个模拟包含异构产品数据的多个店铺,并要求智能体执行复杂检索任务的电子商务基准。我们通过引入 WebMall 来填补这一空白,这是首个用于在挑战性比较购物任务上评估 Web 智能体的离线多店铺基准。WebMall 由四个模拟店铺组成,这些店铺填充了从 Common Crawl 提取的产品数据。WebMall 的任务范围从特定产品搜索和价格比较,到互补或替代产品的高级搜索,以及结账流程。我们使用八个在观察空间、短期记忆可用性以及所采用的大语言模型方面各不相同的智能体来验证 WebMall。验证结果凸显了该基准的难度,表现最佳的智能体在最便宜产品搜索和模糊产品搜索任务类别中的任务完成率低于 65%。

关键词

引用

@article{arxiv.2508.13024,
  title  = {WebMall -- A Multi-Shop Benchmark for Evaluating Web Agents},
  author = {Ralph Peeters and Aaron Steiner and Luca Schwarz and Julian Yuya Caspary and Christian Bizer},
  journal= {arXiv preprint arXiv:2508.13024},
  year   = {2026}
}

备注

Accepted for publication at SIGIR 2026