中文

WindowsWorld:一个面向专业跨应用环境中自主 GUI 智能体的以流程为中心的基准测试

人工智能 2026-05-01 v1 计算与语言

摘要

尽管 GUI 智能体在诸如 OSWorld 等常见计算机使用任务中展现了令人印象深刻的能力,但当前的基准测试主要关注孤立的单应用任务。这忽略了一个关键的现实世界需求,即跨多个应用程序协调以完成复杂的特定专业工作流程。为了弥合这一差距,我们提出了一个名为 WindowsWorld 的跨应用工作流计算机使用基准测试,旨在系统地评估 GUI 智能体在反映现实世界专业活动的复杂多步骤任务上的表现。我们的方法使用一个由 16 种职业引导的多智能体框架来生成带有中间检查的四个难度级别的任务,然后通过人工审核进行细化,并在模拟环境中执行。由此产生的基准测试包含 181 个任务,平均有 5.0 个子目标,跨越 17 个常见的桌面应用程序,其中 78% 本质上是多应用的。领先大模型和智能体的实验结果表明:1) 所有计算机使用智能体在多应用任务上表现不佳(成功率 < 21%),远低于简单单应用任务的性能;2) 它们在需要跨 \geq 3 个应用程序进行条件判断和推理的任务上大多失败,停滞在早期的子目标上;3) 执行效率低下,尽管远超人类步骤限制,任务仍经常失败。代码、基准测试数据和评估资源可在 github.com/HITsz-TMG/WindowsWorld 获取。

关键词

引用

@article{arxiv.2604.27776,
  title  = {WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments},
  author = {Jinchao Li and Yunxin Li and Chenrui Zhao and Zhenran Xu and Baotian Hu and Min Zhang},
  journal= {arXiv preprint arXiv:2604.27776},
  year   = {2026}
}