中文

DigiRL:用于野外设备控制的自主强化学习训练

机器学习 2024-06-20 v1

摘要

视觉语言模型 (VLMs) 的训练语料库通常缺乏足够的决策导向数据。这使得即插即用的 VLMs 在此类决策任务(如通过图形用户界面 (GUI) 进行野外设备控制)方面不够理想。尽管使用静态演示进行训练在一定程度上取得了一些希望,但我们发现此类方法在处理真实 GUI 控制中的随机性和非平稳性时表现不足,这些因素未能在静态观察数据中得到捕捉。本文介绍了一种新型自主强化学习方法,称为 DigiRL,用于通过微调预训练 VLMs 来训练野外设备控制智能体。该方法分为两个阶段:离线强化学习以初始化模型,随后进行离线到在线强化学习。为实现此目标,我们构建了一个可扩展且可并行的 Android 学习环境,配备基于 VLMs 的评估器,并开发了一种简单而有效的强化学习方法以适应此领域。我们的 approach 使用优势加权强化学习,优势估计器经过增强以考虑沿路径的随机性,并配备一种自动课程,以获得最大学习信号。我们使用 Android-in-the-Wild (AitW) 数据集演示了 DigiRL 的有效性,通过 RL 训练的 130 亿参数 VLMs 实现了从 17.7% 提升至 67.2% 的绝对成功率提升——超过使用静态人类演示数据进行监督微调的 17.7% 成功率。这一结果显著超过了包括 AppAgent 使用 GPT-4V (8.3% 成功率) 和使用 AitW 数据训练的 170 亿参数 CogAgent (38.5% 成功率) 的先前最佳智能体,以及基于筛选后行为克隆的先前最佳自主 RL 方法 (57.8% 成功率),从而在野外设备控制的数字智能体领域树立了新的最佳水平。

关键词

引用

@article{arxiv.2406.11896,
  title  = {DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning},
  author = {Hao Bai and Yifei Zhou and Mert Cemri and Jiayi Pan and Alane Suhr and Sergey Levine and Aviral Kumar},
  journal= {arXiv preprint arXiv:2406.11896},
  year   = {2024}
}

备注

11 pages of main text, 28 pages in total