热力学变分目标的高斯过程_bandit 优化
机器学习
2020-11-24 v3
摘要
热力学变分目标(TVO)是近期提出的一种涉及一维黎曼积分近似的对数证据变分下界,要充分发挥其潜力,需要选择一组有序离散化点的“调度”。本文引入一种定制的高斯过程 bandit 优化方法,用于自动选择这些点。我们的方法不仅自动化了其一一次性选择,还在优化过程中动态适应其位置,从而改进了模型学习与推断。我们提供了理论保证,证明我们的 bandit 优化收敛到使遗憾最小化的积分点选择。我们在变分自编码器与 Sigmoid 信念网络中的改进学习与推断方面提供了算法的经验验证。
引用
@article{arxiv.2010.15750,
title = {Gaussian Process Bandit Optimization of the Thermodynamic Variational Objective},
author = {Vu Nguyen and Vaden Masrani and Rob Brekelmans and Michael A. Osborne and Frank Wood},
journal= {arXiv preprint arXiv:2010.15750},
year = {2020}
}
备注
NeurIPS 2020