成功或缓慢学习:移动应用控制的样本高效离策略强化学习
机器学习
2025-11-14 v2
摘要
使用面向多回合任务的基础模型进行强化学习(RL)的策略近似仍具有挑战性。我们基于稀疏奖励设置和策略梯度更新,识别出两个主要局限性,从而提出关键洞察:来自高回报正样本的更新通常不需要策略正则化,而来自负样本的更新——反映不理想行为——则可能损害模型性能。本文引入 Succeed or Learn Slowly (SoLS),一种新的离策略 RL 算法,已在移动应用控制任务上进行评估。SoLS 在针对用户界面导航微调基础模型时提高了样本效率,采用修改后的离策略 actor-critic 方法,对正样本应用直接策略更新,对负样本采用保守、正则化的更新以防止模型退化。我们将 SoLS 与 Successful Transition Replay (STR) 结合使用,该方法优先从成功交互中进行学习,从而进一步提高样本效率。在 AndroidWorld 基准测试中,SoLS 显著优于现有方法(至少提高 17%),包括提示工程和 RL 方法,同时比基于 GPT-4o 的方法在计算资源上要求大幅降低,推理速度快 5-60 倍。
引用
@article{arxiv.2509.01720,
title = {Succeed or Learn Slowly: Sample Efficient Off-Policy Reinforcement Learning for Mobile App Control},
author = {Georgios Papoudakis and Thomas Coste and Jianye Hao and Jun Wang and Kun Shao},
journal= {arXiv preprint arXiv:2509.01720},
year = {2025}
}
备注
NeurIPS 2025