变分自编码器中的推断网络滞后与后验坍缩
机器学习
2019-01-30 v2 机器学习
摘要
变分自编码器(VAE)是一种深度潜变量模型及其配套变分学习技术的流行组合。通过使用神经推断网络来近似模型在潜变量上的后验,VAE高效地参数化了一个边际数据似然的下界,该下界可直接通过梯度方法优化。然而在实践中,VAE训练常导致一种称为“后验坍缩”的退化局部最优,即模型学会忽略潜变量且近似后验模仿先验。本文从训练动力学的视角研究后验坍缩。我们发现,在训练初期,推断网络无法近似模型的真实后验,而真实后验是一个移动目标。结果,模型被鼓励忽略潜编码并发生后验坍缩。基于该观察,我们提出一种极简的VAE训练修改以减少推断滞后:根据模型当前潜变量与观测间的互信息,我们在每次模型更新前激进地优化推断网络。尽管相较于基础VAE既未引入新模型组件也未增加显著复杂度,我们的方法能够避免困扰大量先前工作的坍缩问题。经验上,我们的方法在文本和图像基准上以留出似然优于强自回归基线,并与更复杂的避免坍缩技术具有竞争力,同时显著更快。
引用
@article{arxiv.1901.05534,
title = {Lagging Inference Networks and Posterior Collapse in Variational Autoencoders},
author = {Junxian He and Daniel Spokoyny and Graham Neubig and Taylor Berg-Kirkpatrick},
journal= {arXiv preprint arXiv:1901.05534},
year = {2019}
}
备注
ICLR 2019 Conference Paper