中文

ACtuAL:对抗学习下的 Actor-Critic 方法

机器学习 2017-11-15 v1 机器学习

摘要

生成对抗网络(GANs)是深度生成建模的有力框架。作为两人零和极小极大问题,GANs 通常在实值数据上端到端训练,并可用于训练高维逼真图像的生成器。然而,GANs 的一个主要局限在于训练依赖判别器经反向传播将梯度传递过生成器。这使其从根本上难以用离散数据训练 GANs,因为此时生成通常涉及一种不可微函数。当动作空间由离散决策构成时,这些困难也延伸至强化学习设定。我们通过重构 GAN 框架来解决这些问题:生成器不再利用经判别器的梯度训练,而是借助 actor-critic 框架中带时序差分(TD)目标的习得评论家训练。这非常契合序列建模,并借此在语言建模任务上较标准 Teacher-Forcing 方法取得改进。

关键词

引用

@article{arxiv.1711.04755,
  title  = {ACtuAL: Actor-Critic Under Adversarial Learning},
  author = {Anirudh Goyal and Nan Rosemary Ke and Alex Lamb and R Devon Hjelm and Chris Pal and Joelle Pineau and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1711.04755},
  year   = {2017}
}