中文

蒙特卡洛目标的双重重参数化梯度估计器

机器学习 2018-11-20 v2 机器学习

摘要

深度潜变量模型因 (Kingma & Welling, 2013; Rezende et al., 2014) 提出的可扩展学习算法而成为一种流行的模型选择。这些方法最大化观测数据难以处理的对数似然上的变分下界。Burda 等人 (2015) 引入了多样本变分界 IWAE,它至少与标准变分下界一样紧,并随着样本数量增加而变得越来越紧。与直觉相反,IWAE 界典型的推断网络梯度估计器随着样本数增加而表现糟糕 (Rainforth et al., 2018; Le et al., 2018)。Roeder 等人 (2017) 提出了一种改进的梯度估计器,但未能证明其无偏。我们证明它实际上是有偏的,并且该偏差可通过再次应用重参数化技巧高效估计。双重重参数化梯度(DReG)估计器不会随样本数增加而退化,从而解决了先前提出的问题。同一思想可用于改进许多近期提出的潜变量模型训练技术。特别地,我们表明该估计器降低了 IWAE 梯度、重加权唤醒-睡眠更新(RWS)(Bornschein & Bengio, 2014) 和刀切变分推断(JVI)梯度 (Nowozin, 2018) 的方差。最后,我们表明这一计算高效、无偏的即插即用梯度估计器在多个建模任务上转化为对所有三个目标的性能提升。

关键词

引用

@article{arxiv.1810.04152,
  title  = {Doubly Reparameterized Gradient Estimators for Monte Carlo Objectives},
  author = {George Tucker and Dieterich Lawson and Shixiang Gu and Chris J. Maddison},
  journal= {arXiv preprint arXiv:1810.04152},
  year   = {2018}
}