结构化蒸馏 Web 智能体能力以实现泛化
机器学习
2026-04-10 v1
摘要
前沿大语言模型(LLM)能够导航复杂网站,但其成本高昂且依赖第三方 API,使本地部署难以实现。我们提出Agent-as-Annotators框架,通过类比人类标注角色来结构化合成轨迹生成,以取代任务设计者、标注者和监督者,采用模块化 LLM 组件。以 Gemini 3 Pro 作为教师模型,我们生成 3,000 个轨迹,覆盖六个 web 环境,并在通过质量筛选后的 2,322 个轨迹上进行纯监督学习式微调 9B 参数的学生模型。最终模型在 WebArena 上取得 41.5% 的成绩,超越 Claude 3.5 Sonnet(36.0%)和 GPT-4o(31.5%)等闭源模型,几乎翻倍于前一最佳开源权重结果(Go-Browse,21.7%)。能力可迁移至未见环境,在 WorkArena L1(一个在训练期间从未看到的企业平台)上获得 18.2 个百分点的提升,并在三个额外基准上持续获得改进。消融实验确认每个管道组件都有实质性贡献,其中 Judge 过滤、评估提示和推理痕迹每个都造成可衡量的提升。这些结果表明,仅凭单个前沿教师从结构化轨迹合成即可产生具竞争力、可本地部署的 web 智能体。项目页面:https://agent-as-annotators.github.io
引用
@article{arxiv.2604.07776,
title = {Structured Distillation of Web Agent Capabilities Enables Generalization},
author = {Xing Han Lù and Siva Reddy},
journal= {arXiv preprint arXiv:2604.07776},
year = {2026}
}