中文

变分自编码器的零方差梯度

机器学习 2026-02-27 v2

摘要

训练深度生成模型(如变分自编码器,VAEs)需要通过随机潜在变量传递梯度,这会引入估计方差,可能延缓收敛并降低性能。本文探索了一条正交方向,我们称为静默梯度(Silent Gradients)。通过限制解码器架构的特定方式,可以解析计算预期的 ELBO。这导致梯度具有零估计方差,因为我们可以直接计算证据下界,而无需对潜在变量进行蒙特卡罗抽样。我们首先在线性解码器的受控环境中提供理论分析,展示了相对于标准估计器的优化改进。为将这一思想扩展到具有表达力的非线性解码器,我们引入一种训练范式,使用解析梯度指导早期编码器学习,然后退回标准随机估计器。在多个数据集上,我们的方法在 reparameterization、Gumbel-Softmax 和 REINFORCE 等既定基线上 consistently 实现改进。这些结果表明,能够实现解析期望计算的架构选择可以显著稳定具有随机组件的生成模型训练。

关键词

引用

@article{arxiv.2508.03587,
  title  = {Zero-Variance Gradients for Variational Autoencoders},
  author = {Zilei Shao and Anji Liu and Guy Van den Broeck},
  journal= {arXiv preprint arXiv:2508.03587},
  year   = {2026}
}