Avenir-Web:基于 grounding expert mixture 的仿人体验多模态网页智能体
人工智能
2026-02-03 v1 计算与语言
摘要
尽管多模态大型语言模型取得了进展,自动化网页智能体仍在复杂动态网页界面上执行长期任务时仍面临可靠性挑战。现有方法常因元素定位不准、缺乏站点特定程序知识以及长期任务跟踪和记忆不稳定而受限,尤其是在处理复杂文档对象模型(DOM)结构时。为此,我们提出 Avenir-Web,一个在 Online-Mind2Web 基准上实现新型开源最佳成绩的网页智能体。Avenir-Web 利用 grounding expert 的 mixture、Experience-Imitation Planning 用于整合程序先验知识,以及任务跟踪清单结合自适应记忆,实现了跨多样化用户界面范式的稳健无缝交互。我们在 Online-Mind2Web 上进行评估,该基准包含真实且以用户为中心的网页任务。结果表明,Avenir-Web显著超越了现有开源智能体,性能与顶级专有模型持平,为 live 网站上的可靠网页智能体树立了新的开源最佳纪元。
引用
@article{arxiv.2602.02468,
title = {Avenir-Web: Human-Experience-Imitating Multimodal Web Agents with Mixture of Grounding Experts},
author = {Aiden Yiliu Li and Xinyue Hao and Shilong Liu and Mengdi Wang},
journal= {arXiv preprint arXiv:2602.02468},
year = {2026}
}