超越像素:基于 DOM 降采样的 LLM 驱动 Web 代理探索
人工智能
2025-11-03 v2 计算与语言
人机交互
摘要
前沿 LLM 仅最近才 enabled 可服务的、自主的 web agent。在此基础上,模型充当即时域模型后端。若需建议交互,便 Consult 基于 web 的任务及其相应应用状态。关键问题在于应用状态序列化——即所谓的快照。最新 web agent 基于 grounded GUI 快照,即增强了视觉线索的截图。其次,为模拟人类感知,同时因图像在模型输入方面相对经济。LLM 视觉仍落后于代码解释能力。DOM 快照因其结构类似 HTML,构成一种理想的替代方案。然而,巨大的模型输入 token 规模,使目前尚无法可靠实现 web agent。我们提出 D2Snap,即一种首创的 DOM 降采样算法。基于 GPT-4o 后端,我们在来自 Online-Mind2Web 数据集中抽取的任务上评估了 D2Snap。D2Snap 降采样后的 DOM 快照成功率(67%)与 grounded GUI 快照基线(65%)相当——在同一输入 token 数量级(1e3)内。我们最佳评估配置——虽略高于一个 token 量级,但仍在模型的上下文窗口范围内——超越了该基线 8%。我们的评估进一步表明,DOM 内在的层次结构为 LLM 所需的 UI 特征提供了强大的支持。
引用
@article{arxiv.2508.04412,
title = {Beyond Pixels: Exploring DOM Downsampling for LLM-Based Web Agents},
author = {Thassilo M. Schiepanski and Nicholas Piël},
journal= {arXiv preprint arXiv:2508.04412},
year = {2025}
}
备注
20 pages, LaTeX; repository URL updated, typos corrected