中文

Cramér 距离:有偏 Wasserstein 梯度的解决方案

机器学习 2017-06-01 v1 机器学习

摘要

Wasserstein 概率度量受到了机器学习界的广泛关注。与严格衡量概率变化的 Kullback-Leibler 散度不同,Wasserstein 度量反映了结果之间的底层几何结构。对这种几何结构敏感的价值已在有序回归和生成建模等任务中得到证明。本文描述了概率散度的三个自然性质,这些性质反映了机器学习的要求:和不变性、尺度敏感性和无偏样本梯度。Wasserstein 度量具有前两个性质,但与 Kullback-Leibler 散度不同,它不具备第三个性质。我们提供的经验证据表明这在实践中是一个严重问题。借鉴概率预测的见解,我们提出了 Wasserstein 度量的替代方案——Cramér 距离。我们证明 Cramér 距离具备所有三个期望的性质,结合了 Wasserstein 散度和 Kullback-Leibler 散度的优点。为说明 Cramér 距离在实践中的相关性,我们设计了一种新算法——Cramér 生成对抗网络(GAN),并证明其性能显著优于相关的 Wasserstein GAN。

关键词

引用

@article{arxiv.1705.10743,
  title  = {The Cramer Distance as a Solution to Biased Wasserstein Gradients},
  author = {Marc G. Bellemare and Ivo Danihelka and Will Dabney and Shakir Mohamed and Balaji Lakshminarayanan and Stephan Hoyer and Rémi Munos},
  journal= {arXiv preprint arXiv:1705.10743},
  year   = {2017}
}