中文

ShowUI-$\pi$:基于流生成模型的 GUI 灵巧手

计算机视觉与模式识别 2026-01-01 v1 人工智能 人机交互

摘要

构建能够进行灵巧操作的智能体,是实现机器人和数字环境中类人自动化的关键任务。然而,现有的 GUI 智能体依赖离散点击预测 (x,y)(x,y),无法实现需要连续感知和调整的自由形式、闭环轨迹(例如拖动进度条)。本文我们开发了 ShowUI-π\pi,首个作为 GUI 灵巧手的流生成模型,具有以下设计:(i) 统一的离散-连续动作,将离散点击和连续拖拽集成于共享模型中,实现跨多种交互模式的灵活适应;(ii) 基于流的动作生成用于拖拽建模,通过轻量级动作专家从连续视觉观测预测增量光标调整,确保轨迹平滑稳定;(iii) 拖拽训练数据和基准,我们手动收集并合成 20K 条拖拽轨迹,覆盖五个领域(如 PowerPoint、Adobe Premiere Pro),并引入 ScreenDrag 基准,提供全面的在线和离线评估协议,以评估 GUI 智能体的拖拽能力。我们的实验表明,专有 GUI 智能体在 ScreenDrag 上仍表现不佳(例如 Operator 得分 13.27,最佳 Gemini-2.5-CUA 仅达 22.18),而 ShowUI-π\pi 仅用 4.5 亿参数即可达到 26.98,凸显了该任务的难度以及我们方法的有效性。我们希望本工作推动 GUI 智能体向数字世界中类人灵巧控制迈进。代码已公开于 https://github.com/showlab/showui-pi。

关键词

引用

@article{arxiv.2512.24965,
  title  = {ShowUI-$\pi$: Flow-based Generative Models as GUI Dexterous Hands},
  author = {Siyuan Hu and Kevin Qinghong Lin and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2512.24965},
  year   = {2026}
}

备注

17 pages, 15 figures