用于表示学习的Wasserstein依赖度量
机器学习
2019-03-29 v1 机器学习
摘要
互信息最大化已成为无监督表示学习的有力学习目标,在物体识别、语音识别和强化学习等应用中取得最先进性能。然而,此类方法存在根本局限,因为互信息的紧下界所需样本量随互信息呈指数增长。这限制了这些方法在高互信息预测任务(如视频理解或强化学习)中的适用性。在这些设定下,此类技术易于过拟合(理论与实践中皆然),且仅捕捉少量相关变异因素。这导致不完整的表示,对下游任务并非最优。本工作中,我们实证表明基于互信息的表示学习方法在若干设计任务与真实世界任务上确实未能学习到完整表示。为缓解这些问题,我们引入Wasserstein依赖度量,该度量通过在互信息估计器中使用Wasserstein距离替代KL散度来学习更完整的表示。我们展示了这一理论驱动解的实用近似,其利用GAN文献中的Lipschitz约束技术构建,在完整表示是主要挑战的任务上取得了显著改进的结果。
引用
@article{arxiv.1903.11780,
title = {Wasserstein Dependency Measure for Representation Learning},
author = {Sherjil Ozair and Corey Lynch and Yoshua Bengio and Aaron van den Oord and Sergey Levine and Pierre Sermanet},
journal= {arXiv preprint arXiv:1903.11780},
year = {2019}
}