中文

面向离线强化学习与模仿学习的引导式数据增强

机器学习 2024-08-09 v3 机器人学

摘要

在离线强化学习(RL)中,RL 智能体仅使用先前收集的固定数据集来学习解决任务。虽然离线 RL 已成功学习真实世界的机器人控制策略,但它通常需要大量专家质量的数据来学习可泛化到分布外状态的有效策略。不幸的是,此类数据在真实世界任务中往往难以获取且成本高昂。近期的若干工作利用数据增强(DA)来低成本地生成额外数据,但大多数 DA 工作以随机方式应用增强,最终产生高度次优的增强经验。在本工作中,我们提出引导式数据增强(GuDA),一种生成专家质量增强数据的人引导 DA 框架。GuDA 背后的关键洞见是:虽然演示生成专家数据所需的动作序列可能困难,但用户通常可以轻松刻画一段增强轨迹何时代表朝向任务完成的进展。因此,用户可以限制可能增强的空间以自动拒绝次优的增强数据。为从 GuDA 中提取策略,我们使用现成的离线强化学习和行为克隆算法。我们在物理机器人足球任务以及模拟的 D4RL 导航任务、模拟自动驾驶任务和模拟足球任务上评估 GuDA。实证上,GuDA 能够在给定少量可能次优经验的初始数据集的情况下实现学习,并且优于随机 DA 策略以及基于模型的 DA 策略。

关键词

引用

@article{arxiv.2310.18247,
  title  = {Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning},
  author = {Nicholas E. Corrado and Yuxiao Qu and John U. Balis and Adam Labiosa and Josiah P. Hanna},
  journal= {arXiv preprint arXiv:2310.18247},
  year   = {2024}
}

备注

RLC 2024