中文

Web智能体的观察降维:基于轻量级框架的全面评估

计算与语言 2026-05-29 v1

摘要

LLM-based web智能体的HTML观察极为冗长,尽管已提出许多降维方法,但仍不清楚哪些方法能在降低整体代理延迟的同时保持性能。主要障碍是端到端评估成本高昂:在我们的实验中,对11种方法在32种配置上在33个任务上的WorkArena L1评估耗时累计为232.4小时。为此,我们提出基于最小失败集(Minimal Failure Set, MFS)的轻量级评估框架,即移除导致任务失败的最小HTML元素集合。我们定义覆盖率(coverage)为降维方法完全保留MFS的实例比例,该指标无需Web访问或LLM推理。我们验证了覆盖率与端到端成功率之间存在强相关性,在两个基准上累计评估时间加快了超过100倍。使用该框架,我们发现提取HTML降维方法要么需要高计算成本,要么需要针对特定领域的优化才能在保持性能的同时降低代理延迟。基于此,我们在MFS训练数据上优化了一个修剪程序,在WorkArena L1上实现了2.2倍的每步延迟加速,保留84%的原始成功率;在WebLinx上实现了3.1倍的加速,保留89%的成功率。

关键词

引用

@article{arxiv.2605.29397,
  title  = {Revisiting Observation Reduction for Web Agents: Comprehensive Evaluation with a Lightweight Framework},
  author = {Masafumi Enomoto and Ryoma Obara and Haochen Zhang and Masafumi Oyamada},
  journal= {arXiv preprint arXiv:2605.29397},
  year   = {2026}
}

备注

22 pages, 8 figures, 4 tables