SeqGAN:基于策略梯度的序列生成对抗网络
机器学习
2017-08-28 v6 人工智能
摘要
作为一种训练生成模型的新方法,使用判别模型引导生成模型训练的生成对抗网络(GAN)在生成实值数据方面取得了相当大的成功。然而,当目标是生成离散标记序列时,它存在局限性。一个主要原因在于生成模型的离散输出使得难以将梯度更新从判别模型传递给生成模型。此外,判别模型只能评估完整序列,而对于部分生成的序列,一旦整个序列生成完毕,要平衡其当前得分与未来得分并非易事。在本文中,我们提出一种称为SeqGAN的序列生成框架来解决这些问题。将数据生成器建模为强化学习(RL)中的随机策略,SeqGAN通过直接执行策略梯度更新绕过了生成器微分问题。RL奖励信号来自对完整序列进行判别的GAN判别器,并通过蒙特卡洛搜索传回中间状态-动作步骤。在合成数据和真实世界任务上的大量实验表明相对于强基线有显著改进。
引用
@article{arxiv.1609.05473,
title = {SeqGAN: Sequence Generative Adversarial Nets with Policy Gradient},
author = {Lantao Yu and Weinan Zhang and Jun Wang and Yong Yu},
journal= {arXiv preprint arXiv:1609.05473},
year = {2017}
}
备注
The Thirty-First AAAI Conference on Artificial Intelligence (AAAI 2017)