中文

融合行为克隆与强化学习以提升稠密与稀疏奖励环境下的性能

机器学习 2020-04-07 v2 人工智能 机器学习

摘要

本文研究如何借助离策略 actor-critic(演员-评论家)强化学习,高效地对最初由演示数据训练得到的策略进行迁移与更新。众所周知,基于从演示中学习(例如行为克隆)的技术能在有限数据下得到熟练策略。然而,目前尚不清楚如何高效地用强化学习来更新该策略,因为这些方法本质上优化的是不同的目标函数。已有工作采用将行为克隆损失与强化学习损失相结合的损失函数来实现此种更新。但是,这些损失函数的各组成部分常凭经验设定,其各自贡献尚不明确。本工作中,我们提出 Cycle-of-Learning(CoL,学习循环)框架,其采用 actor-critic 架构,损失函数将行为克隆与 1-step Q-learning(一步 Q 学习)损失相结合,并包含来自人类演示的离策略预训练步骤。这使得从行为克隆到强化学习的过渡无性能退化,并在总体性能与训练时间上改进了强化学习。此外,我们细致研究了这些组合损失的构成及其对整体策略学习的影响。我们表明,在稠密与稀疏奖励场景下,我们的方法均优于融合行为克隆与强化学习的当前最优技术。我们的结果还提示,直接在演示数据上计入行为克隆损失有助于确保稳定学习并为后续策略更新奠定基础。

关键词

引用

@article{arxiv.1910.04281,
  title  = {Integrating Behavior Cloning and Reinforcement Learning for Improved Performance in Dense and Sparse Reward Environments},
  author = {Vinicius G. Goecks and Gregory M. Gremillion and Vernon J. Lawhern and John Valasek and Nicholas R. Waytowich},
  journal= {arXiv preprint arXiv:1910.04281},
  year   = {2020}
}

备注

9 pages, 5 Figures. AAMAS 2020