基于 f-散度最小化的深度能量模型训练
机器学习
2020-07-22 v2 机器学习
摘要
深度能量模型(EBMs)在分布参数化上非常灵活,但由于难处理的配分函数而在计算上具有挑战性。它们通常通过最大似然进行训练,使用对比散度来近似数据和模型分布之间 KL 散度的梯度。虽然 KL 散度具有许多理想性质,其他 f-散度在训练隐式密度生成模型(如生成对抗网络)时已显示出优势。在本文中,我们提出了一个称为 f-EBM 的通用变分框架,以使用任意期望的 f-散度来训练 EBMs。我们引入了相应的优化算法,并利用非线性动力系统理论证明了其局部收敛性质。实验结果证明了 f-EBM 相对于对比散度的优越性,以及使用 KL 以外的 f-散度训练 EBMs 的益处。
引用
@article{arxiv.2003.03463,
title = {Training Deep Energy-Based Models with f-Divergence Minimization},
author = {Lantao Yu and Yang Song and Jiaming Song and Stefano Ermon},
journal= {arXiv preprint arXiv:2003.03463},
year = {2020}
}
备注
ICML 2020