Prune4Web:面向 Web Agent 的 DOM 树剪枝编程
人工智能
2025-11-27 v1 计算与语言
人机交互
多智能体系统
摘要
Web 自动化利用智能代理通过模拟人类与网页界面交互来执行高层任务。尽管近期大型语言模型(LLM)基于 Web 的代理具备相应能力,但在高效导航复杂真实网页方面仍是重大挑战,由于文档对象模型(DOM)结构的庞大大小,通常范围在 1 万至 10 万 token 之间。现有策略通常依赖粗糙的 DOM 截断——风险在于丢失关键信息——或采用低效的启发式方法和独立的排序模型,难以在精度与可扩展性之间实现最佳平衡。为此,我们引入 Prune4Web,这是一种新范式,将 DOM 处理从资源密集型的 LLM 读取转向高效的程序化剪枝。我们方法的核心是 DOM 树剪枝编程,即 LLM 生成可执行的 Python 评分脚本,以基于分解子任务中的语义线索动态筛选 DOM 元素。该机制消除了 LLM 必须摄入原始大型 DOM 的需求,转而将遍历和评分委托给轻量、可解释的程序。该方法实现了对候选元素的 25 倍至 50 倍降低,从而促进了精确的动作定位,同时缓解了注意力稀释。此外,我们提出了一套专门的数据标注管道和两轮对话训练策略,在统一框架中联合优化 Planner、Programmatic Filter 和 Grounder。广泛的实验结果表明,我们实现了最先进的性能。值得注意的是,在我们的低级定位任务上,Prune4Web 将准确率从 46.8% 提升至 88.28%,凸显了其在真实世界 Web 自动化中的有效性。
引用
@article{arxiv.2511.21398,
title = {Prune4Web: DOM Tree Pruning Programming for Web Agent},
author = {Jiayuan Zhang and Kaiquan Chen and Zhihao Lu and Enshen Zhou and Qian Yu and Jing Zhang},
journal= {arXiv preprint arXiv:2511.21398},
year = {2025}
}
备注
Paper accepted to AAAI 2026