AutoFocus:基于不确定性的 GUI grounding 主动视觉搜索
计算机视觉与模式识别
2026-05-05 v1
摘要
视觉语言模型(VLMs)已实现将自然语言指令转化为可执行屏幕坐标的自主 GUI 代理,但在高分辨率界面上,因稠密布局和小型交互元素,模型输入约束与现代显示器分辨率之间存在鸿沟,导致 grounding 性能下降。现有放大策略依赖固定锚点、启发式网格或强化学习,缺乏原则化机制来自适应确定何处需要细化以及应探索多少空间不确定性。我们提出 AutoFocus,一个训练自由、基于不确定性的 GUI grounding 主动视觉搜索框架。我们的关键洞察是,坐标生成过程中基于 token 的perplexity 天然反映了空间不确定性。我们不致于单一预测,而是对多个坐标假设进行采样,将其轴向perplexity 转换为各向各异的高斯空间概率场,显式建模方向性不确定性。基于该概率场,我们生成全局和局部区域提案,引入基于形状的放大以平衡紧致定位与上下文保留。随后通过基于视觉提示的聚合步骤进行结构化比较,以选择最一致的预测。在 ScreenSpot-Pro 和 ScreenSpot-V2 上的大规模实验表明,我们在通用型和专为 GUI 优化的 VLMs 之间均实现了持续的性能提升。
引用
@article{arxiv.2605.02630,
title = {AutoFocus: Uncertainty-Aware Active Visual Search for GUI Grounding},
author = {Ruilin Yao and Shegnwu Xiong and Tianyu Zou and Shili Xiong and Yi Rong},
journal= {arXiv preprint arXiv:2605.02630},
year = {2026}
}
备注
18 pages, 4 figures