中文

无外在奖励的判别器软演员评论家方法

机器学习 2020-02-03 v3 机器学习

摘要

从少量专家数据与采样数据在未知状态下很好地模仿是困难的。行为克隆等监督学习方法不需要采样数据,但通常受困于分布偏移。基于强化学习的方法,如逆强化学习与生成对抗模仿学习(GAIL),可从仅少量专家数据学习,但往往需要与环境交互。软 Q 模仿学习解决了这些问题,并已证明可通过结合行为克隆与带恒定奖励的软 Q 学习实现高效学习。为使该算法对分布偏移更鲁棒,我们提出判别器软演员评论家(DSAC)。其使用基于对抗逆强化学习的奖励函数取代恒定奖励。我们在仅有四条专家轨迹的 PyBullet 环境中进行了评估。

关键词

引用

@article{arxiv.2001.06808,
  title  = {Discriminator Soft Actor Critic without Extrinsic Rewards},
  author = {Daichi Nishio and Daiki Kuyoshi and Toi Tsuneda and Satoshi Yamane},
  journal= {arXiv preprint arXiv:2001.06808},
  year   = {2020}
}