摊销变分推断:何时以及为何?
机器学习
2024-05-27 v4 机器学习
摘要
在概率潜变量模型中,因子化(或平均场)变分推断(F-VI)为每个潜变量拟合一个独立的参数化分布。摊销变分推断(A-VI)则学习一个共同的推断函数,将每个观测映射到其对应潜变量的近似后验。通常,A-VI 被用作变分自编码器训练中的一步,但有理据表明 A-VI 也可作为 F-VI 的通用替代方案。在本文中,我们研究何时以及为何 A-VI 可用于近似贝叶斯推断。我们推导了潜变量模型上必要、充分且可验证的条件,在这些条件下 A-VI 能达到 F-VI 的最优解,从而弥合摊销差距(amortization gap)。我们证明这些条件仅由简单层次模型唯一验证,这是机器学习中涵盖许多模型的广泛类别。然后,在更广泛的模型类别上,我们展示如何扩展 A-VI 推断函数的定义域以改进其解,并给出例如隐马尔可夫模型等摊销差距无法被弥合的示例。
引用
@article{arxiv.2307.11018,
title = {Amortized Variational Inference: When and Why?},
author = {Charles C. Margossian and David M. Blei},
journal= {arXiv preprint arXiv:2307.11018},
year = {2024}
}