中文

如何对二值深度玻尔兹曼机进行中心化

机器学习 2017-02-08 v3 机器学习

摘要

本文分析了中心化的二值受限玻尔兹曼机 (RBM) 和二值深度玻尔兹曼机 (DBM),其中中心化是通过从可见变量和隐藏变量中减去偏移值来实现的。我们通过解析证明:(i) 中心化对于一般的人工神经网络而言产生了一种不同但等价的参数化形式;(ii) 对于零到一范围内的任意偏移值,中心化二值 RBM/DBM 的期望性能在数据和偏移量同时翻转下保持不变;(iii) 中心化可以重新表述为普通二值 RBM/DBM 的不同更新规则;(iv) 使用增强梯度 (enhanced gradient) 等价于将偏移值设置为模型均值和数据均值的平均值。此外,数值模拟表明:(i) 通过从可见变量和隐藏变量中减去均值可实现最优生成性能;(ii) 中心化 RBM/DBM 达到的对数似然值显著高于普通二值 RBM/DBM;(iii) 偏移量依赖于模型均值的中心化变体(如增强梯度)会遭受严重的发散问题;(iv) 若对偏移值使用批均值的指数移动平均而非当前批均值,学习过程将得到稳定,这也能防止增强梯度发散;(v) 中心化 RBM/DBM 在拥有更小权重矩阵范数的同时,能达到比普通 RBM/DBM 更高的对数似然 (LL) 值;(vi) 中心化导致的更新方向更接近自然梯度,且自然梯度对于训练 RBM 极为高效;(vii) 中心化免除了对 DBM 进行贪婪逐层预训练的需求;(viii) 此外,我们表明预训练往往会恶化结果,无论是否使用中心化;(ix) 中心化对自编码器 (auto encoders) 同样有益。

关键词

引用

@article{arxiv.1311.1354,
  title  = {How to Center Binary Deep Boltzmann Machines},
  author = {Jan Melchior and Asja Fischer and Laurenz Wiskott},
  journal= {arXiv preprint arXiv:1311.1354},
  year   = {2017}
}

备注

Author list in meta data corrected - 57 pages, 17 figures, 13 tables