中文

Look Before You Leap:面向 GUI 自动化的 GUI-Critic-R1 模型

人工智能 2025-11-18 v2

摘要

近年来,多模态大语言模型(MLLM)被广泛应用于多模态推理任务,包括图形用户界面(GUI)自动化。不同于通用的离线多模态任务,GUI 自动化在在线交互环境中执行, necessitating 基于实时环境状态的逐步决策。该任务对每一步决策的容错率较低,因为任何错误都可能累积性地干扰进程,甚至导致不可逆操作,如删除文件或完成支付。为此,我们引入一种 pre-operative(操作前)批评机制,通过推理动作的潜在结果和正确性来提供有效反馈。具体而言,我们提出了一种基于 Suggestion-aware Gradient Relative Policy Optimization(S-GRPO)的策略,以构建我们的 pre-operative 批评模型 GUI-Critic-R1,纳入新颖的建议奖励以增强模型反馈的可靠性。进一步,我们开发了基于推理引导的数据收集管道,以创建 GUI-Critic-Train 和 GUI-Critic-Test,填补了 GUI 批评数据方面的现有空白。在跨移动和网页领域的 GUI-Critic-Test 上的静态实验结果表明,我们的 GUI-Critic-R1 在批评准确性方面显著优于当前 MLLM。动态评估在 GUI 自动化基准测试中进一步凸显了该模型的有效性和优越性,证据包括提升后的成功率和操作效率。

关键词

引用

@article{arxiv.2506.04614,
  title  = {Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation},
  author = {Yuyang Wanyan and Xi Zhang and Haiyang Xu and Haowei Liu and Junyang Wang and Jiabo Ye and Yutong Kou and Ming Yan and Fei Huang and Xiaoshan Yang and Weiming Dong and Changsheng Xu},
  journal= {arXiv preprint arXiv:2506.04614},
  year   = {2025}
}