判别器- actor-critic:解决对抗模仿学习中的样本低效与奖励偏差问题
机器学习
2018-10-16 v2 机器学习
摘要
我们指出了基于对抗模仿学习框架的一类算法存在的两个问题。第一个问题是这些算法所用奖励函数中存在的隐式偏差。虽然这些偏差在某些环境中可能表现良好,但在其他环境中也可能导致次优行为。其次,尽管这些算法可以从少量专家示范中学习,但对于许多实际应用而言,它们需要与环境进行极其大量的交互才能模仿专家。为解决这些问题,我们提出了一种称为判别器-actor-critic(Discriminator-Actor-Critic)的新算法,该算法使用离策略强化学习(off-policy Reinforcement Learning)将策略-环境交互的样本复杂度平均降低 10 倍。此外,由于我们的奖励函数设计为无偏的,因此无需任何任务特定调整即可将算法应用于许多问题。
引用
@article{arxiv.1809.02925,
title = {Discriminator-Actor-Critic: Addressing Sample Inefficiency and Reward Bias in Adversarial Imitation Learning},
author = {Ilya Kostrikov and Kumar Krishna Agrawal and Debidatta Dwibedi and Sergey Levine and Jonathan Tompson},
journal= {arXiv preprint arXiv:1809.02925},
year = {2018}
}