一种批归一化推断网络使 KL 消失问题不再发生
机器学习
2020-06-02 v2 计算与语言
摘要
变分自编码器(VAE)被广泛用作生成模型,通过结合摊销变分推断与深度神经网络来近似模型在隐变量上的后验。然而,当与强自回归解码器配对时,VAE 常收敛到一种称为“后验坍缩”的退化局部最优。先前的方法针对每个数据点单独考虑 Kullback-Leibler 散度(KL)。我们提出让 KL 在整个数据集上服从一个分布,并分析得出只需保持该 KL 分布的期望为正即可防止后验坍缩。随后我们提出批归一化 VAE(BN-VAE),一种简单而有效的方法,通过对近似后验参数的分布进行正则化来设定该期望的下界。在不引入任何新模型组件或修改目标函数的情况下,我们的方法能高效且有效地避免后验坍缩。我们进一步表明所提出的 BN-VAE 可扩展至条件 VAE(CVAE)。在实验上,我们的方法在语言建模、文本分类和对话生成上超越了强自回归基线,并与更复杂的方法相媲美,同时训练时间几乎与 VAE 相同。
引用
@article{arxiv.2004.12585,
title = {A Batch Normalized Inference Network Keeps the KL Vanishing Away},
author = {Qile Zhu and Jianlin Su and Wei Bi and Xiaojiang Liu and Xiyao Ma and Xiaolin Li and Dapeng Wu},
journal= {arXiv preprint arXiv:2004.12585},
year = {2020}
}
备注
An extension for the original ACL 2020 paper