对比散度学习是一种时间反演对抗博弈
机器学习
2021-03-17 v3 机器学习
摘要
对比散度(CD)学习是一种将未归一化统计模型拟合到数据样本的经典方法。尽管被广泛使用,该算法的收敛性质仍未被很好理解。困难的主要来源是用于推导损失梯度的一个未经证实的近似。在本文中,我们给出 CD 的一种替代推导,不需要任何近似,并揭示了算法实际所优化目标的新的认识。具体而言,我们表明 CD 是一种对抗学习过程,其中判别器试图分类由模型生成的马尔可夫链是否被时间反演。因此,尽管早于生成对抗网络(GANs)十余年,CD 实际上与这些技术密切相关。我们的推导与先前观察一致,即 CD 的更新步骤无法表示为任何固定目标函数的梯度。此外,作为副产品,我们的推导揭示了一种简单修正,可用作 Metropolis-Hastings 拒绝的替代,当底层马尔可夫链不精确时(例如使用大步长的 Langevin 动力学)需要该拒绝。
引用
@article{arxiv.2012.03295,
title = {Contrastive Divergence Learning is a Time Reversal Adversarial Game},
author = {Omer Yair and Tomer Michaeli},
journal= {arXiv preprint arXiv:2012.03295},
year = {2021}
}