中文

AdaZoom-GUI: 基于自适应缩放的 GUI 定位与指令细化

计算机视觉与模式识别 2026-03-19 v1 人工智能

摘要

GUI 定位是视觉-语言模型(VLM)的一项关键能力,使自动化与图形用户界面的交互成为可能,通过自然语言指令定位目标元素。然而,在 GUI 截图上进行定位仍然具有挑战性,原因包括高分辨率图像、小型 UI 元素和模糊的用户指令。在这项工作中,我们提出了 AdaZoom-GUI,一个基于自适应缩放的 GUI 定位框架,同时提高了定位准确性和指令理解。我们的方法引入了一个指令细化模块,将自然语言命令重写为明确且详细的描述,使定位模型能够专注于精确的元素定位。此外,我们设计了一个条件缩放策略,选择性地对预测的小元素进行第二阶段推理,在提高定位准确性的同时避免了简单情况下的不必要计算和上下文丢失。为了支持该框架,我们构建了一个高质量的 GUI 定位数据集,并使用组相对策略优化(GRPO)训练定位模型,使模型能够预测点击坐标和元素边界框。在公开基准上的实验表明,我们的方法在参数规模相当甚至更大的模型中达到了最先进的性能,突出了其在高分辨率 GUI 理解和实际 GUI 智能体部署方面的有效性。

关键词

引用

@article{arxiv.2603.17441,
  title  = {AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement},
  author = {Siqi Pei and Liang Tang and Tiaonan Duan and Long Chen and Shuxian Li and Kaer Huang and Yanzhe Jing and Yiqiang Yan and Bo Zhang and Chenghao Jiang and Borui Zhang and Jiwen Lu},
  journal= {arXiv preprint arXiv:2603.17441},
  year   = {2026}
}