中文

基于过参数化浅层神经网络的能量模型对偶训练

机器学习 2022-02-16 v2 最优化与控制 机器学习

摘要

能量模型(EBMs)是通常通过最大似然估计训练的 generative models(生成模型)。由于需要采样与该能量相关的 Gibbs 分布,当所训练的能量非凸时,这一方法在一般情况下变得具有挑战性。利用一般的 Fenchel 对偶结果,我们推导了具有浅层过参数化神经网络能量的极大似然 EBM 的对偶变分原理,涵盖了特征学习机制和惰性线性化机制。在特征学习机制中,该对偶公式证明了使用两时间尺度梯度上升-下降(GDA)训练算法的合理性,其中同时更新样本空间中的粒子和能量参数空间中的神经元。我们还考虑了该算法的一个变体,其中粒子有时从数据集中随机抽取的样本重新初始化,并表明在每次迭代步骤执行这些重新初始化对应于 score matching(分数匹配)训练。这些结果在简单的数值实验中得到说明,表明当特征和粒子以相似时间尺度更新时 GDA 表现最佳。

关键词

引用

@article{arxiv.2107.05134,
  title  = {Dual Training of Energy-Based Models with Overparametrized Shallow Neural Networks},
  author = {Carles Domingo-Enrich and Alberto Bietti and Marylou Gabrié and Joan Bruna and Eric Vanden-Eijnden},
  journal= {arXiv preprint arXiv:2107.05134},
  year   = {2022}
}