中文

从 grounding 到 planning:Web智能体基准测试中的瓶颈

人工智能 2026-03-03 v1 多智能体系统

摘要

通用 web 基智能体对于与复杂 web 环境交互至关重要,但在实际 web 应用中其表现仍然不佳,即使使用最先进的模型也几乎没有准确率。我们注意到,这些智能体可以分解为两个主要组件:规划和 grounding。然而,大多数现有研究将这些智能体视为黑盒子,仅进行端到端评估,这阻碍了有意义的改进。我们加强了规划与 grounding 组件之间的区别,通过对 Mind2Web 数据集进行细化实验的新分析。我们的工作为每个组件分别提出了新的基准,识别限制智能体性能的瓶颈和痛点。与普遍假设相反,我们的发现表明,grounding 并非主要瓶颈,可以通过当前技术有效解决。相反,主要挑战在于规划组件,这是性能下降的主要来源。通过这一分析,我们提供了新的见解,展示了改善 web 智能体能力的实用建议,为更可靠的智能体铺平了道路。

关键词

引用

@article{arxiv.2409.01927,
  title  = {From Grounding to Planning: Benchmarking Bottlenecks in Web Agents},
  author = {Segev Shlomov and Ben wiesel and Aviad Sela and Ido Levy and Liane Galanti and Roy Abitbol},
  journal= {arXiv preprint arXiv:2409.01927},
  year   = {2026}
}