AutoGUI:利用大语言模型自动生成功能标注以扩展GUI元素定位
计算机视觉与模式识别
2025-06-10 v2
摘要
利用视觉-语言模型(VLM)进行用户界面理解因其增强软件自动化的潜力而备受关注。然而,用于构建UI-VLM的现有数据集要么只包含大规模的无上下文元素标注,要么只包含小规模的上下文功能描述。在这项工作中,我们提出了 \textbf{AutoGUI} 流水线,用于大规模自动为UI元素标注详细的功能描述。具体而言,我们利用大型语言模型(LLM)通过比较模拟交互前后的UI状态变化来推断元素功能。为了提高标注质量,我们提出了LLM辅助的拒绝和验证机制,无需人工即可消除无效标注。我们使用所提出的流水线构建了一个高质量的 AutoGUI-704k 数据集,该数据集具有多样且详细的功能标注,这是以往数据集难以提供的。人工评估表明,我们的标注正确性可与训练有素的人工标注员相媲美。大量实验表明,我们的数据集显著增强了VLM的UI元素定位能力,并表现出显著的规模效应。我们还展示了该数据集在UI智能体任务中的有趣潜在用途。请访问我们的项目页面 https://autogui-project.github.io/。
引用
@article{arxiv.2502.01977,
title = {AutoGUI: Scaling GUI Grounding with Automatic Functionality Annotations from LLMs},
author = {Hongxin Li and Jingfan Chen and Jingran Su and Yuntao Chen and Qing Li and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:2502.01977},
year = {2025}
}
备注
Accepted to ACL 2025 Main