基于 MCMC 的最大似然能量模型学习的解剖分析
机器学习
2019-12-02 v4 计算机视觉与模式识别
机器学习
摘要
本研究探讨了马尔可夫链蒙特卡洛(MCMC)采样在无监督最大似然(ML)学习中的影响。我们将关注点限制在负对数密度(或能量函数)为卷积网络(ConvNet)的一类非归一化概率密度上。我们发现,先前研究中用于稳定训练的许多技术并非必要。使用 ConvNet 势函数的 ML 学习仅需少量超参数且无需正则化。利用这一最简框架,我们识别出多种仅依赖于 MCMC 采样实现的 ML 学习效果。一方面,我们表明利用短程 Langevin 采样训练一个能够生成逼真图像的能量模型是容易的。即使在整个训练过程中 MCMC 样本的能量远高于真实稳态样本,ML 仍可有效且稳定。基于这一见解,我们提出了一种采用纯噪声初始化 MCMC、高质量短程合成且与 CD 或 PCD 等含信息 MCMC 初始化 ML 具有相同计算开销的 ML 方法。与先前模型不同,我们的能量模型在训练后能从噪声信号获得逼真且高多样性的样本。另一方面,使用非收敛 MCMC 学习得到的 ConvNet 势函数不具备有效的稳态,并且由于长程 MCMC 样本与观测图像差异巨大,不能被视为训练数据的近似非归一化密度。我们表明,训练一个 ConvNet 势函数以学习逼真图像上的稳态要困难得多。据我们所知,所有先前模型的长程 MCMC 样本均丧失了短程样本的逼真性。通过正确调节 Langevin 噪声,我们训练出了首个长程与稳态 MCMC 样本均为逼真图像的 ConvNet 势函数。
引用
@article{arxiv.1903.12370,
title = {On the Anatomy of MCMC-Based Maximum Likelihood Learning of Energy-Based Models},
author = {Erik Nijkamp and Mitch Hill and Tian Han and Song-Chun Zhu and Ying Nian Wu},
journal= {arXiv preprint arXiv:1903.12370},
year = {2019}
}
备注
Code available at: https://github.com/point0bar1/ebm-anatomy