中文

非对抗模仿学习及其与对抗方法的联系

机器学习 2020-08-11 v1 信息论 机器人学 math.IT 机器学习

摘要

许多现代模仿学习和逆强化学习方法,如 GAIL 或 AIRL,基于对抗式公式。这些方法应用 GANs 将专家在状态与动作上的分布与智能体策略所诱导的隐式状态-动作分布进行匹配。然而,通过将模仿学习框定为鞍点问题,对抗方法可能遭受优化不稳定的困扰,且收敛性仅能在小的策略更新下得到证明。我们通过提出一个非对抗模仿学习框架来解决这些问题。所得算法与其对抗对应物相似,从而为进一步理解对抗模仿学习方法提供了洞见。最值得注意的是,我们表明 AIRL 是我们非对抗公式的一个实例,这使我们能极大简化其推导并获得更强的收敛保证。我们还表明,我们的非对抗公式可用于推导新算法:提出了一种受近期 ValueDice 算法启发的离线模仿学习方法,但其收敛不依赖于小的策略更新。在我们的模拟机器人实验中,我们的非对抗模仿学习离线方法似乎在每次迭代对策略和判别器使用多次更新时表现最佳,并优于行为克隆和 ValueDice。

关键词

引用

@article{arxiv.2008.03525,
  title  = {Non-Adversarial Imitation Learning and its Connections to Adversarial Methods},
  author = {Oleg Arenz and Gerhard Neumann},
  journal= {arXiv preprint arXiv:2008.03525},
  year   = {2020}
}