中文

变分判别器瓶颈:通过约束信息流改进模仿学习、逆强化学习与 GAN

机器学习 2020-08-26 v4 机器学习

摘要

对抗学习方法已被提出用于广泛的应用,但对抗模型的训练可能极其不稳定。有效平衡生成器与判别器的性能至关重要,因为达到非常高准确率的判别器将产生相对无信息的梯度。在这项工作中,我们提出一种简单而通用的技术,通过信息瓶颈约束判别器中的信息流。通过对观测值与判别器内部表示之间的互信息施加约束,我们可以有效调节判别器的准确率并维持有用且具信息的梯度。我们证明,我们提出的变分判别器瓶颈(VDB)在对抗学习算法的三个不同应用领域均带来显著改进。我们的主要评估研究了 VDB 对动态连续控制技能(如奔跑)模仿学习的适用性。我们表明,我们的方法可直接从\emph{原始}视频演示中学习此类技能,大幅优于先前的对抗模仿学习方法。VDB 也可与对抗逆强化学习结合,以学习简洁的奖励函数,这些函数可在新环境中迁移并重新优化。最后,我们证明 VDB 能更有效地训练用于图像生成的 GAN,改进了若干先前的稳定化方法。

关键词

引用

@article{arxiv.1810.00821,
  title  = {Variational Discriminator Bottleneck: Improving Imitation Learning, Inverse RL, and GANs by Constraining Information Flow},
  author = {Xue Bin Peng and Angjoo Kanazawa and Sam Toyer and Pieter Abbeel and Sergey Levine},
  journal= {arXiv preprint arXiv:1810.00821},
  year   = {2020}
}