FocusUI:基于位置保持视觉标记选择的高效 UI 基准
计算机视觉与模式识别
2026-01-08 v1 人工智能
计算与语言
人机交互
摘要
视觉语言模型(VLM)在用户界面(UI)基准任务中表现突出,得益于其处理高分辨率屏幕截图的能力。然而,屏幕被分解为数千个视觉标记(例如,2K 分辨率约为 4700 个),造成显著的计算开销并稀释注意力。相比之下,人类在与 UI 交互时通常只关注感兴趣的区域。在本工作中,我们首次提出高效 UI 基准任务。基于对任务特征和挑战的实用分析,我们提出 FocusUI 框架,通过选择与指令最相关的 patch 同时保持位置连续性来实现精确的基准。FocusUI 解决了两个关键挑战:(1) 消除视觉编码中的冗余标记。我们通过融合指令条件得分与基于规则的 UI 图得分来构建 patch 级别的监督,该得分对降低大型均匀区域的权重以选择 distinct 且指令相关的视觉标记。(2) 在视觉标记选择期间保持位置连续性。我们发现,通用的视觉标记修剪方法在 UI 基准任务上会因位置信息被破坏而严重降低准确率。我们引入 novel PosPad strategy,将每个连续的被丢弃视觉标记压缩为单个特殊标记置于序列最后一个索引处,以保持位置连续性。全面实验表明,FocusUI 在四个基准上均优于 GUI-specific baseline。在 ScreenSpot-Pro 基准上,FocusUI-7B 相较于 GUI-Actor-7B 实现了 3.7% 的性能提升。即使仅保留 30% 的视觉标记,FocusUI-7B 也仅下降 3.2%,同时实现了最高 1.44 倍的推理速度和 17% 的峰值 GPU 内存降低。
引用
@article{arxiv.2601.03928,
title = {FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection},
author = {Mingyu Ouyang and Kevin Qinghong Lin and Mike Zheng Shou and Hwee Tou Ng},
journal= {arXiv preprint arXiv:2601.03928},
year = {2026}
}
备注
14 pages, 13 figures