中文

FocusUI:基于位置保持视觉标记选择的高效 UI grounding

投资组合管理 2026-01-08 v1 机器学习

摘要

视觉-语言模型 (VLM) 在用户界面 (UI) grounding 任务中显示出卓越的性能,这得益于其能够处理日益高分辨率的屏幕截图。然而,屏幕截图被分解为数千个视觉标记(约 2K 分辨率约为 4700 个),造成显著计算开销并稀释注意力。相比之下,人类在与 UI 交互时通常只关注感兴趣区域。本文 pioneers 高效 UI grounding 任务。基于对任务特征与挑战的实用分析,我们提出 FocusUI 框架,通过选择与指令最相关的图像块同时保持位置连续性来实现高效 grounding。FocusUI 解决了两个关键挑战:(1) 消除视觉编码中的冗余标记。我们通过融合指令条件得分与基于规则的 UI 图谱得分来构建 patch 级别的监督,该得分对大面积均匀区域进行降权,以选择与指令相关且差异化的视觉标记。(2) 在视觉标记选择过程中保持位置连续性。我们发现,通用的视觉标记修剪方法在 UI grounding 任务上因位置信息被破坏而严重降低准确率。我们引入 novel PosPad 策略,将被丢弃的视觉标记的每个连续序列压缩为单个特殊标记,置于序列的最后一个索引位置以保持位置连续性。基于四个 grounding 基准的全面实验表明,FocusUI 超越了 GUI-specific 的基线。在 ScreenSpot-Pro 基准上,FocusUI-7B 相较于 GUI-Actor-7B 实现了 3.7% 的性能提升。即使仅保留 30% 的视觉标记,FocusUI-7B 也仅下降 3.2%,同时实现最高 1.44 倍的推理速度和 17% 的峰值 GPU 内存降低。

关键词

引用

@article{arxiv.2601.03927,
  title  = {A comprehensive review and analysis of different modeling approaches for financial index tracking problem},
  author = {Vrinda Dhingra and Amita Sharma and Anubha Goel},
  journal= {arXiv preprint arXiv:2601.03927},
  year   = {2026}
}