中文

WebAgents综述:面向大型基础模型的下一代Web自动化AI代理

人工智能 2025-08-06 v4

摘要

随着 web 技术的发展,它们显著改变了人们生活的各个方面。尽管 web 如此重要,但执行其上任务的许多任务都是重复且耗时的,这会对整体生活质量产生负面影响。为了高效处理这些单调的日常任务,一种前景十足的做法是发展基于人工智能 (AI) 技术的自主代理,即 AI 代理,因为它们可以在不知疲倦或性能下降的情况下持续运行。在 web 语境下,利用 AI 代理(称为 WebAgents)自动帮助人们处理繁琐的日常任务可以显著提升生产力和效率。最近,包含数十亿参数的大型基础模型 (LFMs) 展现出类人语言理解和推理能力,在执行各种复杂任务方面表现出色。这自然引出了一个问题: LFMs能否被用于开发强大的 AI 代理,以自动处理 web 任务,为用户提供显著的便利?为了充分探索 LFMs 的潜力,大量研究涌现于旨在根据用户指令完成日常 web 任务的 WebAgents 上,显著提升了日常人类生活的便利性。在本综述中,我们全面回顾了 WebAgents 相关研究在三个关键方面:架构、训练和可信度。此外,还探讨了若干有前景的未来研究方向,以提供更深入的见解。

关键词

引用

@article{arxiv.2503.23350,
  title  = {A Survey of WebAgents: Towards Next-Generation AI Agents for Web Automation with Large Foundation Models},
  author = {Liangbo Ning and Ziran Liang and Zhuohang Jiang and Haohao Qu and Yujuan Ding and Wenqi Fan and Xiao-yong Wei and Shanru Lin and Hui Liu and Philip S. Yu and Qing Li},
  journal= {arXiv preprint arXiv:2503.23350},
  year   = {2025}
}

备注

This is the long version of the corresponding survey paper accepted by KDD 2025. The tutorial and corresponding slides are available at https://biglemon-ning.github.io/WebAgents/