生成对抗网络、逆强化学习与基于能量模型之间的联系
机器学习
2016-11-28 v3 人工智能
摘要
生成对抗网络(GANs)是最近提出的一类生成模型,其中生成器被训练以优化一个代价函数,而该代价函数正由判别器同时学习。尽管学习代价函数的想法在生成建模领域相对较新,但学习代价在控制和强化学习(RL)领域已被长期研究,通常用于从演示中模仿学习。在这些领域中,学习观测行为底层的代价函数被称为逆强化学习(IRL)或逆最优控制。尽管起初RL中的代价学习与生成建模中的代价学习之间的联系看似表面,我们在本文中表明某些IRL方法事实上与GANs数学等价。特别地,我们证明了最大熵IRL的一种基于样本的算法与一种GAN等价,其中生成器的密度可被评估并作为额外输入提供给判别器。有趣的是,最大熵IRL是基于能量模型的一个特例。我们讨论了将GANs解释为训练基于能量模型的算法,并将此解释关联到近期其他试图连接GANs与EBMs的工作。通过正式强调GANs、IRL和EBMs之间的联系,我们希望三个领域的研究者能更好地识别并应用可迁移的思想从一个领域到另一个,特别是用于开发更稳定且可扩展的算法:这是所有三个领域的主要挑战。
引用
@article{arxiv.1611.03852,
title = {A Connection between Generative Adversarial Networks, Inverse Reinforcement Learning, and Energy-Based Models},
author = {Chelsea Finn and Paul Christiano and Pieter Abbeel and Sergey Levine},
journal= {arXiv preprint arXiv:1611.03852},
year = {2016}
}
备注
NIPS 2016 Workshop on Adversarial Training. First two authors contributed equally