ShowUI-$\pi$:基于流生成模型的 GUI 灵巧手
计算机视觉与模式识别
2026-01-01 v1 人工智能
人机交互
摘要
构建能够进行灵巧操作的智能体,是实现机器人和数字环境中类人自动化的关键任务。然而,现有的 GUI 智能体依赖离散点击预测 ,无法实现需要连续感知和调整的自由形式、闭环轨迹(例如拖动进度条)。本文我们开发了 ShowUI-,首个作为 GUI 灵巧手的流生成模型,具有以下设计:(i) 统一的离散-连续动作,将离散点击和连续拖拽集成于共享模型中,实现跨多种交互模式的灵活适应;(ii) 基于流的动作生成用于拖拽建模,通过轻量级动作专家从连续视觉观测预测增量光标调整,确保轨迹平滑稳定;(iii) 拖拽训练数据和基准,我们手动收集并合成 20K 条拖拽轨迹,覆盖五个领域(如 PowerPoint、Adobe Premiere Pro),并引入 ScreenDrag 基准,提供全面的在线和离线评估协议,以评估 GUI 智能体的拖拽能力。我们的实验表明,专有 GUI 智能体在 ScreenDrag 上仍表现不佳(例如 Operator 得分 13.27,最佳 Gemini-2.5-CUA 仅达 22.18),而 ShowUI- 仅用 4.5 亿参数即可达到 26.98,凸显了该任务的难度以及我们方法的有效性。我们希望本工作推动 GUI 智能体向数字世界中类人灵巧控制迈进。代码已公开于 https://github.com/showlab/showui-pi。
关键词
引用
@article{arxiv.2512.24965,
title = {ShowUI-$\pi$: Flow-based Generative Models as GUI Dexterous Hands},
author = {Siyuan Hu and Kevin Qinghong Lin and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2512.24965},
year = {2026}
}
备注
17 pages, 15 figures