中文

对比散度学习是一种时间反演对抗博弈

机器学习 2021-03-17 v3 机器学习

摘要

对比散度(CD)学习是一种将未归一化统计模型拟合到数据样本的经典方法。尽管被广泛使用,该算法的收敛性质仍未被很好理解。困难的主要来源是用于推导损失梯度的一个未经证实的近似。在本文中,我们给出 CD 的一种替代推导,不需要任何近似,并揭示了算法实际所优化目标的新的认识。具体而言,我们表明 CD 是一种对抗学习过程,其中判别器试图分类由模型生成的马尔可夫链是否被时间反演。因此,尽管早于生成对抗网络(GANs)十余年,CD 实际上与这些技术密切相关。我们的推导与先前观察一致,即 CD 的更新步骤无法表示为任何固定目标函数的梯度。此外,作为副产品,我们的推导揭示了一种简单修正,可用作 Metropolis-Hastings 拒绝的替代,当底层马尔可夫链不精确时(例如使用大步长的 Langevin 动力学)需要该拒绝。

关键词

引用

@article{arxiv.2012.03295,
  title  = {Contrastive Divergence Learning is a Time Reversal Adversarial Game},
  author = {Omer Yair and Tomer Michaeli},
  journal= {arXiv preprint arXiv:2012.03295},
  year   = {2021}
}