中文

通过 Wasserstein 度量的分布匹配正则化神经网络激活值

机器学习 2020-04-28 v2 机器学习

摘要

正则化与归一化已成为训练深度神经网络中不可或缺的组成部分,带来了更快的训练速度和更好的泛化性能。我们提出投影误差函数正则化损失(PER),它鼓励激活值服从标准正态分布。PER 将激活值随机投影到一维空间,并在投影空间中计算正则化损失。PER 在投影空间中类似于 Pseudo-Huber 损失,从而兼具 L1L^1L2L^2 正则化损失的优点。此外,PER 可通过从单位球面上抽取的投影向量捕捉隐藏单元之间的相互作用。由此,PER 最小化激活值的经验分布与标准正态分布之间一阶 Wasserstein 距离的上界。据作者所知,这是首项在概率分布空间中通过分布匹配来正则化激活值的工作。我们在图像分类任务和词级语言建模任务上评估了所提方法。

关键词

引用

@article{arxiv.2002.05366,
  title  = {Regularizing activations in neural networks via distribution matching with the Wasserstein metric},
  author = {Taejong Joo and Donggu Kang and Byunghoon Kim},
  journal= {arXiv preprint arXiv:2002.05366},
  year   = {2020}
}

备注

ICLR 2020