中文

UltraCUA:面向计算机使用智能体的混合动作基础模型

计算机视觉与模式识别 2026-05-27 v3 计算与语言

摘要

计算机使用智能体面临根本性限制。它们仅依赖原始 GUI 动作(点击、输入、滚动),形成脆弱的执行链,容易产生级联性错误。尽管 API 驱动的智能体通过结构化界面和工具充分利用丰富的功能,但计算机使用智能体仍受限于低层视觉交互。我们提出的 UltraCUA 通过混合动作跨越了这一限制——无缝统一原始 GUI 操作与高级工具执行。我们的创新基于四个关键突破:首先,自动化管道从软件文档和代码仓库中提取并扩展工具功能;其次,合成数据引擎生产 17,000 多项可验证任务,捕捉真实世界计算机使用的复杂性;第三,综合性混合动作轨迹收集纳入 GUI 原始操作和战略性工具调用;第四,采用两阶段训练方法结合监督微调与在线强化学习,实现 GUI 与 API 之间的智能动作选择。通过我们的 7B 和 32B UltraCUA 模型评估显示,性能实现了变革性提升。在 OSWorld 上,UltraCUA 实现了 22% 的相对改进,同时执行速度快 11%,平均而言。在 WindowsAgentArena 上进行的跨域验证表明,模型在 Windows 训练的基线之上实现了 21.7% 的成功率。混合动作范式证明至关重要,既减少了错误传播,又提高了执行效率。这项工作建立了可扩展的范式,搭建了原始 GUI 交互与高级工具智能之间的桥梁,为多样化环境和复杂真实任务的更具韧性和适应性的计算机使用智能体提供了可能。

关键词

引用

@article{arxiv.2510.17790,
  title  = {UltraCUA: A Foundation Model for Computer Use Agents with Hybrid Action},
  author = {Yuhao Yang and Zhen Yang and Zi-Yi Dou and Anh Nguyen and Keen You and Omar Attia and Andrew Szot and Michael Feng and Ram Ramrakhya and Alexander Toshev and Chao Huang and Yinfei Yang and Zhe Gan},
  journal= {arXiv preprint arXiv:2510.17790},
  year   = {2026}
}