中文

MVISU-Bench:基于多应用、模糊、交互、单应用和不道德指令基准测试移动智能体

计算与语言 2025-08-18 v2

摘要

鉴于大型视觉语言模型(LVLMs)在推理和视觉理解方面取得的显著进展,移动智能体正快速涌现以满足用户的自动化需求。然而,现有评估基准与实际世界脱节,未能充分应对用户日益多样化和复杂的需求。通过对用户问卷的广泛收集,我们识别出五类任务:多应用指令、模糊指令、交互式指令、单应用指令和不道德指令。围绕这些任务,我们提出了包含404个任务、覆盖137个移动应用的双语基准测试——\textbf{MVISU-Bench}。此外,我们提出了Aider,一个即插即用模块,充当动态提示词生成器,以缓解风险并澄清用户意图。我们的Aider易于集成到多个框架中,在MVISU-Bench上的当前最先进方法(SOTA)之上,整体成功率提升了19.55%。具体而言,对于不道德指令和交互式指令,成功率分别提升了53.52%和29.41%。通过大量实验和分析,我们凸显了现有移动智能体与实际用户期望之间的差距。

关键词

引用

@article{arxiv.2508.09057,
  title  = {MVISU-Bench: Benchmarking Mobile Agents for Real-World Tasks by Multi-App, Vague, Interactive, Single-App and Unethical Instructions},
  author = {Zeyu Huang and Juyuan Wang and Longfeng Chen and Boyi Xiao and Leng Cai and Yawen Zeng and Jin Xu},
  journal= {arXiv preprint arXiv:2508.09057},
  year   = {2025}
}

备注

ACM MM 2025