进度的幻象?对当前 Web 代理能力的全面评估
人工智能
2025-10-09 v4 计算与语言
摘要
随着数字化和云技术的不断演进,网页在现代社会中日益重要。基于大型语言模型(LLM)的自主网页代理在工作自动化方面拥有巨大潜力。因此,准确衡量和监控其能力的进展至关重要。本文我们对当前 Web 代理的当前状态进行全面且严谨的评估。我们的结果描绘了当前代理能力的截然不同的图景,表明此前报告的结果可能过于乐观。这一差距可归因于现有基准的不足。我们引入了 Online-Mind2Web,这是一个在线评估基准,包含 300 个跨越 136 个网站的多样且真实的任务。它使我们能够在接近真实用户使用这些代理的方式下进行评估。为促进更可扩展的评估和开发,我们还开发了一种新型的 LLM-as-a-Judge 自动评估方法,并表明它可实现约 85% 的人工判断一致性,显著高于现有方法。最后,我们Present了当前 Web 代理的首个全面比较分析,既突出了它们的优势,也揭示了它们的局限性,以激励未来研究。
引用
@article{arxiv.2504.01382,
title = {An Illusion of Progress? Assessing the Current State of Web Agents},
author = {Tianci Xue and Weijian Qi and Tianneng Shi and Chan Hee Song and Boyu Gou and Dawn Song and Huan Sun and Yu Su},
journal= {arXiv preprint arXiv:2504.01382},
year = {2025}
}
备注
22 pages, 17 figures, 7 tables