DRIVE:用于连续学习下的 Web 智能体的推理与交互水平技能建模
人工智能
2026-05-26 v1 机器学习
摘要
Web 智能体需要具备高级推理能力(用于任务分解)和低级交互能力(用于页面元素操作),才能完成不同任务。然而,这些知识类型根本不同:推理知识(例如预订机票需要先搜索路线)抽象且可跨网站迁移,而交互知识(例如在 Site A 的特定坐标点击 Search 按钮)高度依赖页面特定上下文。现有方法统一存储经验,导致困境:抽象表征在具体页面上丢失可执行性,而具体表征则无法跨域泛化。这种纠缠限制了能力积累:在新网站上,智能体要么因表层差异未能识别可重用任务逻辑,要么因过时页面结构 attempting 不可行的动作。为此,我们提出 DRIVE,一种双水平技能建模框架,将历史经验分离为自然语言推理技能,捕获可迁移的任务逻辑,以及程序化交互技能,将抽象动作 grounding 到可执行操作。DRIVE 还使用技能水平反思识别特定层次的失败模式,实现针对性的技能库扩展和细化。在五个 WebArena 领域的实验中,DRIVE 实现了平均 52.8% 的任务成功率,显著高于无技能基线的 7.3 个百分点。进一步的消融实验表明,推理技能和交互技能提供了独特且互补的益处,支持将可迁移的任务逻辑与可执行的页面级操作分离。
引用
@article{arxiv.2605.23939,
title = {DRIVE: Modeling Skills at the Reasoning and Interaction Levels for Web Agents under Continual Learning},
author = {Xirui Liu and Sihang Zhou and Yanning Hou and Rong Zhou and Haoyuan Chen and Maolin He and Siwei Wang and Hao Chen and Jian Huang},
journal= {arXiv preprint arXiv:2605.23939},
year = {2026}
}
备注
35 pages, 5 figures