InfiGUI-G1:通过自适应探索策略优化推进 GUI 基准
人工智能
2025-12-09 v2 计算与语言
摘要
多模态大型语言模型 (MLLM) 的出现推动了基于纯视觉输入在图形用户界面 (GUI) 上运行的自主智能体开发。一个根本性挑战是稳健地实现自然语言指令的基准化。这需要精确的空间对齐,即准确定位每个元素的坐标,更关键的是正确的语义对齐,即将指令匹配到功能上合适的 UI 元素。尽管强化学习与可验证奖励 (RLVR) 在提高这些 MLLM 的空间对齐方面效果显著,但我们发现低效的探索成为语义对齐的瓶颈,阻止模型学习困难的语义关联。为解决此问题,我们提出了自适应探索策略优化 (AEPO),一种新的策略优化框架。AEPO 采用多答案生成策略以实现更广泛的探索,然后通过从效率 eta=U/C 原理出发推导的自适应探索奖励 (AER) 函数进行引导。我们训练的 AEPO 模型 InfiGUI-G1-3B 和 InfiGUI-G1-7B 在多个具有挑战性的 GUI 基准测试上建立了新的最高成绩,相较于 naïve RLVR 基线在设计用于测试泛化和语义理解的基准测试上实现了最高可达 9.0% 的显著相对提升。资源已置于 https://github.com/InfiXAI/InfiGUI-G1
引用
@article{arxiv.2508.05731,
title = {InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization},
author = {Yuhang Liu and Zeyu Liu and Shuanghe Zhu and Pengxiang Li and Congkai Xie and Jiasheng Wang and Xavier Hu and Xiaotian Han and Jianbo Yuan and Xinyao Wang and Shengyu Zhang and Hongxia Yang and Fei Wu},
journal= {arXiv preprint arXiv:2508.05731},
year = {2025}
}
备注
Accepted to AAAI 2026 (Oral Presentation)