中文

MobileRL:面向移动 GUI 智能体的在线强化学习

机器学习 2025-10-27 v2 人工智能

摘要

随着视觉语言模型的进步,开发通用图形用户界面(GUI)智能体变得日益有前景。然而,由于任务难度呈重尾分布且大规模环境采样效率低下,开发有效的移动 GUI 智能体仍具有挑战性。我们提出的在线智能体强化学习框架 MobileRL 旨在增强移动环境中的 GUI 智能体。其核心组件为难度自适应 GRPO(ADAGRPO)算法。在 ADAGRPO 中,我们设计了难度自适应正向重放和失败课程过滤,以适应不同任务难度。我们引入最短路径奖励调整策略,以重新构建多轮智能体任务中关于任务长度的奖励。这些策略共同稳定了 RL 训练,提高了采样效率,在多样化的移动应用和任务中生成卓越性能。我们将 MobileRL 应用于两个开放模型(Qwen2.5-VL-7B-Instruct 和 GLM-4.1V-9B-Base),得到的 MobileRL-9B 模型在 AndroidWorld(80.2%)和 AndroidLab(53.6%)两个基准测试中成功率均达到最先进水平。MobileRL 框架已开源于:https://github.com/THUDM/MobileRL。

关键词

引用

@article{arxiv.2509.18119,
  title  = {MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents},
  author = {Yifan Xu and Xiao Liu and Xinghan Liu and Jiaqi Fu and Hanchen Zhang and Bohao Jing and Shudan Zhang and Yuting Wang and Wenyi Zhao and Yuxiao Dong},
  journal= {arXiv preprint arXiv:2509.18119},
  year   = {2025}
}