中文

用于文本生成的对抗训练归一化噪声特征自编码器

计算与语言 2018-11-13 v1 机器学习

摘要

本文提出用于字节级文本生成的对抗训练归一化噪声特征自编码器(ATNNFAE)。一个 ATNNFAE 由一个自编码器组成,其中内部编码在单位球面上归一化并受加性噪声污染。同时,解码器的一个副本(与自编码器解码器共享相同参数)被用作生成器,并输入随机隐向量。一个对抗判别器被训练以区分从自编码器重建的训练样本与通过随机输入生成器产生的样本,使得整个生成器-判别器路径对文本等离散数据可微。编码中噪声注入与解码器和生成器之间权重共享的联合效应可防止 GAN 中常见的模式坍塌现象。由于困惑度不能应用于非序列文本生成,我们提出了一种使用哈希编码字节级 n-gram 频率之间的总变差距离(NGTVD)的新评估方法。NGTVD 是一个单一基准,可刻画生成文本的质量与多样性。实验在阿拉伯语、汉语和英语的 6 个大规模数据集上给出,并与 n-gram 基线和循环神经网络(RNN)进行比较。对噪声水平和判别器均进行了消融研究。我们发现 RNN 难以与 n-gram 基线竞争,而 ATNNFAE 结果总体具有竞争力。

关键词

引用

@article{arxiv.1811.04201,
  title  = {Adversarially-Trained Normalized Noisy-Feature Auto-Encoder for Text Generation},
  author = {Xiang Zhang and Yann LeCun},
  journal= {arXiv preprint arXiv:1811.04201},
  year   = {2018}
}