中文

AutoWebGLM:基于大型语言模型的网页导航智能体

计算与语言 2024-10-15 v2

摘要

大型语言模型(LLM)推动了许多智能网页智能体,但大多数现有方法在现实世界网页导航任务中表现远不理想,主要due to以下三个因素:(1)HTML 文本数据的复杂性(2)网页动作的多样性(3)由于 web 开放域本质导致的任务难度。在考虑到这些挑战之后,我们开发基于 ChatGLM3-6B 的开源 AutoWebGLM。AutoWebGLM 可以作为一个 outperform GPT-4 的强大的自动网页导航智能体。受人类浏览模式启发,我们首先设计 HTML 简化算法,用以简洁地表示 webpage,同时保留关键信息。随后,我们采用混合人类-AI 方法构建网页浏览数据用于 curriculum 训练。最后,我们通过强化学习和拒绝抽样来引导模型,进一步促进 webpage 理解、浏览器操作和高效任务分解。为了进行全面评估,我们建立了一个双语基准 -- AutoWebBench -- 用于现实世界的网页导航任务。我们在多样化的网页导航基准上评估了 AutoWebGLM,展示了其在现实环境中应对具有挑战性任务的潜力。相关代码、模型和数据已发布于 \url{https://github.com/THUDM/AutoWebGLM}。

关键词

引用

@article{arxiv.2404.03648,
  title  = {AutoWebGLM: A Large Language Model-based Web Navigating Agent},
  author = {Hanyu Lai and Xiao Liu and Iat Long Iong and Shuntian Yao and Yuxuan Chen and Pengbo Shen and Hao Yu and Hanchen Zhang and Xiaohan Zhang and Yuxiao Dong and Jie Tang},
  journal= {arXiv preprint arXiv:2404.03648},
  year   = {2024}
}

备注

Accepted to KDD 2024