SimuWoB:模拟真实世界移动应用以实现快速且保真的 GUI 智能体基准测试
人工智能
2026-05-26 v1
摘要
由大型语言模型驱动的移动 GUI 智能体发展迅速,迫切需要现实且全面的评估。现有基准测试优先考虑可重复性,但由于在真实应用上构建奖励的困难,通常局限于开源应用或文件操作任务,在基准测试设置和实际使用之间留下了差距。此外,大多数基准测试侧重于基本的定位和导航,对复杂的、长周期交互的覆盖有限。为解决这些局限性,我们引入了 SimuWoB,一个用于移动 GUI 智能体的全合成基准测试,包含 120 个涵盖不同任务类型和难度级别的具有挑战性的任务。我们构建了一个稳健的虚拟环境生成框架,该框架合成高保真任务和环境,并自动为每个任务提供有效奖励。每个环境都部署为一个可通过 URL 访问的无后端网页,从而实现高效且可重复的评估。我们对几个最先进的移动 GUI 智能体进行了全面实验。平均成功率仅为 27.92%,在长周期任务上降至 17.82%,这揭示了当前智能体在复杂场景下的重大弱点。与真实世界样本任务的评估结果比较表明,基于我们合成环境的智能体评估具有良好的泛化性。我们进一步提供了跨关键能力维度的诊断性见解,并讨论了对未来移动 GUI 智能体发展的启示。
引用
@article{arxiv.2605.25160,
title = {SimuWoB: Simulating Real-World Mobile Apps for Fast and Faithful GUI Agent Benchmarking},
author = {Guohong Liu and Jialei Ye and Pengzhi Gao and Wei Liu and Jian Luan and Yunxin Liu and Yuanchun Li},
journal= {arXiv preprint arXiv:2605.25160},
year = {2026}
}