中文

InfiGUI-R1:从反应式行为者发展为 deliberative reasoner 的多模态 GUI Agent

人工智能 2025-04-22 v1 计算与语言

摘要

多模态大型语言模型 (MLLM) 已为图形用户界面 (GUI) Agent 提供了动力,显示出在计算设备上自动化任务方面的前景。近期的研究开始探索 GUI 任务中的推理,取得了鼓舞人心的成果。然而,许多当前方法依赖于手动设计的推理模板,可能导致推理不够稳健和适应性强以应对复杂的 GUI 环境。与此同时,一些现有 Agent 仍作为 Reactive Actor 运行,主要依赖隐式推理,可能缺乏足够的深度以满足需要规划和错误恢复的 GUI 任务。我们认为,推进这些 Agent 的发展需要从反应式行为转向基于深思熟虑的推理。为此,我们引入了 InfiGUI-R1,一个基于 MLLM 的 GUI Agent,通过我们提出的 Actor2Reasoner 框架开发,该框架是一种以推理为中心的、两阶段的训练方法,旨在逐步演变 Agent 从 Reactive Actor 到 Deliberative Reasoner。第一阶段是 Reasoning Injection,旨在建立基本的 reasoner。我们采用 Spatial Reasoning Distillation 将教师模型中的跨模态空间推理能力通过带有显式推理步骤的轨迹传递给 MLLM,使模型能够在生成动作前整合 GUI 视觉-空间信息与逻辑推理。第二阶段是 Deliberation Enhancement,通过强化学习将基本 reasoner 精炼为 deliberative reasoner。该阶段引入了两种方法:Sub-goal Guidance 奖励模型生成准确的中间子目标,Error Recovery Scenario Construction 从识别易出错的步骤中创建失败-恢复训练情景。实验结果表明,InfiGUI-R1 在 GUI grounding 和 trajectory 任务中实现了强性能。资源请参见 https://github.com/Reallm-Labs/InfiGUI-R1。

关键词

引用

@article{arxiv.2504.14239,
  title  = {InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners},
  author = {Yuhang Liu and Pengxiang Li and Congkai Xie and Xavier Hu and Xiaotian Han and Shengyu Zhang and Hongxia Yang and Fei Wu},
  journal= {arXiv preprint arXiv:2504.14239},
  year   = {2025}
}

备注

10 pages, 3 figures, work in progress