再思考,一次点击:通过快速与缓慢系统提升GUI grounding
人工智能
2025-03-11 v1 计算与语言
计算机视觉与模式识别
摘要
人类能够根据任务复杂度灵活地在不同思考模式之间切换:从快速的直观判断到深入的分析性理解。然而,当前基于自然语言指令定位界面元素的GUI grounding系统仅依赖即时预测,缺乏推理,难以理解具有嵌套结构和层次关系的复杂界面布局,限制了其在复杂界面上的有效性。致力于人类双系统认知,本文提出了Focus框架,一种将快速预测与系统分析相结合的novel GUI grounding框架。该框架通过基于任务复杂度的自适应系统切换,在快速与深入处理之间实现效率与准确性的最优平衡。Focus将grounding分解为三个渐进阶段:界面概述、视觉聚焦分析和精确坐标预测。这种结构化分解使我们能够系统性地理解界面布局和视觉关系。大量实验表明,Focus仅使用300K的训练数据和2B参数模型即可实现最先进的性能,优于现有方法。在复杂GUI场景下,Focus在ScreenSpot上实现77.4%的平均准确率,在更具挑战性的ScreenSpot-Pro上实现13.3%的准确率。我们的分析揭示了这种双系统方法的有效性,同时展示了其在提升复杂GUI交互场景方面的潜力。
引用
@article{arxiv.2503.06470,
title = {Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems},
author = {Fei Tang and Yongliang Shen and Hang Zhang and Siqi Chen and Guiyang Hou and Wenqi Zhang and Wenqiao Zhang and Kaitao Song and Weiming Lu and Yueting Zhuang},
journal= {arXiv preprint arXiv:2503.06470},
year = {2025}
}