连接生成对抗网络与行动者-评论家方法
机器学习
2017-01-19 v3 机器学习
摘要
无监督学习中的生成对抗网络(GAN)和强化学习(RL)中的行动者-评论家方法都因难以优化而闻名。两个领域的实践者都积累了大量策略来缓解这些不稳定性并改善训练。在此,我们展示 GAN 可以被视为一种行动者-评论家方法,其环境中的行动者无法影响奖励。我们回顾了每类模型稳定训练的策略,包括两者通用的策略和各自特有的策略。我们还回顾了对 GAN 和 RL 算法的若干扩展,这些扩展具有更复杂的信息流。我们希望通过强调这种形式上的联系,能够鼓励 GAN 和 RL 社区共同开发用于深度网络多级优化的通用、可扩展且稳定的算法,并跨社区汲取灵感。
引用
@article{arxiv.1610.01945,
title = {Connecting Generative Adversarial Networks and Actor-Critic Methods},
author = {David Pfau and Oriol Vinyals},
journal= {arXiv preprint arXiv:1610.01945},
year = {2017}
}
备注
Added comments on inverse reinforcement learning