DRS-GUI:面向免训练图形用户界面定位的动态区域搜索框架
人工智能
2026-05-18 v1
摘要
由多模态大语言模型驱动的图形用户界面智能体在理解和执行用户指令方面展现出令人印象深刻的能力。然而,对于现有方法而言,从充斥着无关界面组件的高分辨率截图中准确定位与指令相关的元素仍然具有挑战性。受人类如何在复杂屏幕上动态调整其感知范围以定位任务相关区域的启发,我们提出了 DRS-GUI,一个免训练的动态区域搜索框架,用于图形用户界面定位,并可无缝集成到现有的多模态大语言模型中。DRS-GUI 引入了一个轻量级 UI 感知器,执行三种类人感知动作(聚焦、平移和散射)以逐步探索界面并生成区域提议。为了动态调度这些动作,我们进一步设计了一个基于蒙特卡洛树搜索的动作规划器。采用区域质量奖励来评估和选择与指令高度相关的区域,从而有效修剪冗余的 UI 元素。实验表明,对于通用和 GUI 专用多模态大语言模型(Qwen2.5-VL-7B 和 UGround-V1-7B),DRS-GUI 在 ScreenSpot-Pro 上带来了 14% 的性能提升,显著增强了定位性能和泛化能力。
引用
@article{arxiv.2605.15542,
title = {DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding},
author = {Yichao Liu and Huawen Shen and Liu Yu and Shiyu Liu and Zeyu Chen and Yu Zhou},
journal= {arXiv preprint arXiv:2605.15542},
year = {2026}
}
备注
11 pages, 8 figures