中文

Mobile-Bench-v2:面向基于 VLM 的移动智能体的更真实更全面的基准

计算与语言 2026-02-03 v3 人工智能

摘要

基于视觉语言模型(VLM)的移动智能体因能与智能手机 GUI 及 XML 结构化文本交互、完成日常任务而日益受到关注。然而,现有在线基准因环境动态变化导致奖励信号不稳定;离线基准则仅通过单路径轨迹评估,与 GUI 任务固有的多解性格局相悖。此外,两种基准均缺乏噪声 app 或指令过度完备,无法考察移动智能体抗噪能力或主动交互能力。为此,我们提出 Mobile-Bench-v2,采用槽位驱动的指令生成方法构建更真实更全面的基准。Mobile-Bench-v2 包含常规任务划分,实现离线多路径评估以考察智能体在任务执行期间获取 step 奖励的能力;设有基于弹窗广告 app 的噪声划分;以及名为 AITZ-Noise 的污染划分以构建真实噪声环境;此外,推出模糊指令划分,预设 Q&A 互动,评估智能体的主动交互能力。我们使用单智能体框架 AppAgent-v1、多智能体框架 Mobile-Agent-v2 以及其他移动智能体(如 UI-Tars、OS-Atlas)进行评估。代码与数据已发布于 https://huggingface.co/datasets/xwk123/MobileBench-v2。

关键词

引用

@article{arxiv.2505.11891,
  title  = {Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents},
  author = {Weikai Xu and Zhizheng Jiang and Yuxuan Liu and Pengzhi Gao and Wei Liu and Jian Luan and Yuanchun Li and Yunxin Liu and Bin Wang and Bo An},
  journal= {arXiv preprint arXiv:2505.11891},
  year   = {2026}
}