中文

想象后见经验回放:面向稀疏奖励任务的基于模型的好奇学习

机器学习 2023-08-10 v2 机器人学

摘要

基于模型的强化学习因其相较于无模型方法更高的数据效率,而成为实用机器人应用中有前景的学习策略。然而,当前最先进的基于模型方法依赖于塑形奖励信号,这类信号难以设计与实现。为此,我们提出一种专为稀疏奖励多目标任务设计的简单基于模型的方法,其免去了复杂的奖励工程需求。该方法称为想象后见经验回放(Imaginary Hindsight Experience Replay),通过将想象数据纳入策略更新来最小化真实世界交互。为改善稀疏奖励设定下的探索,该策略使用标准后见经验回放进行训练,并赋予基于好奇心的内在奖励。在评估中,该方法在OpenAI Gym Fetch Robotics基准任务上相较最先进的基于模型方法平均提升了一个数量级的数据效率。

关键词

引用

@article{arxiv.2110.02414,
  title  = {Imaginary Hindsight Experience Replay: Curious Model-based Learning for Sparse Reward Tasks},
  author = {Robert McCarthy and Qiang Wang and Stephen J. Redmond},
  journal= {arXiv preprint arXiv:2110.02414},
  year   = {2023}
}