中文

Android Coach:通过单状态多动作提升在线智能体训练效率

机器学习 2026-05-11 v2 人工智能

摘要

在线强化学习(RL)是提升 Android 智能体能力的有效方法。然而,引导智能体通过在线交互进行学习由于模拟器的高延迟和现有 RL 算法的样本效率低下而代价高昂。我们识别出当前方法的一个基本局限:单状态单动作范式,该范式通过在线单向 rollout 使用一对一的状态-动作对更新策略,而未充分探索每个昂贵的模拟器状态。在本文中,我们提出了 Android Coach,一个将训练范式转变为单状态多动作的新框架,使智能体能够针对单个在线状态采样并利用多个动作。我们通过学习一个估计动作值的评论家来实现这一点,而无需额外的模拟器开销。为确保评论家充当可靠的教练,我们整合了过程奖励模型,并引入了基于评论家输出平均值的组内优势估计器。大量实验证明了 Android Coach 的有效性和效率:在 AndroidLab 和 AndroidWorld 上分别实现了 7.5% 和 8.3% 的成功率提升,优于 UI-TARS-1.5-7B;在匹配成功率下,其训练效率是单状态单动作方法 PPO 和 GRPO 的 1.4 倍。

关键词

引用

@article{arxiv.2604.07277,
  title  = {Android Coach: Improve Online Agentic Training Efficiency with Single State Multiple Actions},
  author = {Guo Gan and Yuxuan Ding and Cong Chen and Yuwei Ren and Yin Huang and Hong Zhou},
  journal= {arXiv preprint arXiv:2604.07277},
  year   = {2026}
}