BrowserAgent:基于人类启发式网页浏览动作构建 Web 智能体
计算与语言
2025-10-15 v2 人工智能
摘要
利用大语言模型(LLM)高效解决现实问题,越来越依赖于其与动态网页环境交互并自主获取外部信息的能力。虽然 Search-R1 和 WebDancer 等近期研究在解决网页任务方面表现出色,但它们严重依赖额外工具将交互式网页环境转换为静态文本内容。这与人类的浏览行为形成鲜明对比——人类浏览涉及与浏览器的多样化交互,如滚动、点击和输入。本文提出 BrowserAgent,一种通过人类启发式浏览器动作解决复杂任务的更具交互性的智能体。BrowserAgent 通过一组预定义的浏览器动作,经由 Playwright 直接在原始网页上操作。我们采用两阶段训练(监督微调 SFT 和拒绝采样微调 RFT)以提升模型的泛化能力。尽管训练数据显著少于 Search-R1,BrowserAgent 在不同开放问答(Open-QA)任务上取得了更具竞争力的结果。此外,我们引入显式记忆机制以存储跨步骤的关键结论,进一步增强模型在长程任务上的推理能力。值得注意的是,BrowserAgent-7B 在 HotpotQA、2Wiki 和 Bamboogle 等多跳问答任务上较 Search-R1 提升约 20\%。这些结果表明,BrowserAgent 可作为更具交互性和可扩展性的 Web 智能体的更先进框架。
引用
@article{arxiv.2510.10666,
title = {BrowserAgent: Building Web Agents with Human-Inspired Web Browsing Actions},
author = {Tao Yu and Zhengbo Zhang and Zhiheng Lyu and Junhao Gong and Hongzhu Yi and Xinming Wang and Yuxuan Zhou and Jiabing Yang and Ping Nie and Yan Huang and Wenhu Chen},
journal= {arXiv preprint arXiv:2510.10666},
year = {2025}
}
备注
10 pages