OmniGUI:在全模态智能手机环境中对 GUI 智能体进行基准测试
人机交互
2026-05-20 v1 人工智能
摘要
当前的图形用户界面(GUI)智能体基准主要依赖于静态截图。然而,现实世界中的智能手机交互通常要求智能体处理与动作时刻紧密耦合的瞬态音频线索和时序视频动态。为了弥合这一差距,我们引入了 OmniGUI,这是首个旨在全模态智能手机环境中评估 GUI 智能体的步级基准。OmniGUI 提供连续的、交错的多模态输入,包括在每个动作步骤的静态图像、同步音频和视频片段。该数据集涵盖了 29 个应用程序中的 709 个专家演示片段(2,579 个动作步骤),并系统性地标注了客观的多模态依赖级别。由于专用的全模态 GUI 智能体框架目前尚处于起步阶段,我们选择了能够原生处理交错输入的基础全模态模型作为我们初始基线的智能体代理。我们的实证评估表明,尽管当前模型在视觉静态任务上表现出能力,但在需要同步时序和听觉信号的环境中,其动作预测性能显著下降。此外,消融研究分离出了具体的操作瓶颈,特别是在处理与任务无关的环境噪声时的跨模态干扰。完整的数据集、评估流程和基线提示已在补充材料中提供。项目页面:https://omni-gui.github.io。
引用
@article{arxiv.2605.18758,
title = {OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments},
author = {Felix Henry and Xiaochen Lin and Jiangyou Zhu and Yangfan and Bingqian Zhang and Min Chen and Shiyu Huang},
journal= {arXiv preprint arXiv:2605.18758},
year = {2026}
}