中文

Information Dropout:通过噪声计算学习最优表示

机器学习 2017-02-14 v3 机器学习 统计计算

摘要

深度学习中常用的交叉熵损失与最优表示的定义性质密切相关,但并未强制某些关键性质。我们表明,这可以通过添加正则化项来解决,该正则化项进而与在深度神经网络激活中注入乘性噪声相关,其一个特例是常用的dropout方法。我们表明,我们的正则化损失函数可利用Information Dropout高效最小化,这是一种根植于信息论原理的dropout推广,能自动适应数据并更好地利用有限容量的架构。当任务是输入重建时,我们表明损失函数产生变分自编码器(Variational Autoencoder)作为一个特例,从而提供了表示学习、信息论与变分推断之间的联系。最后,我们证明仅通过强制因子化先验即可促进解耦表示的创建,这一事实已在近期工作中被经验观察到。我们的实验验证了方法背后的理论直觉,并且我们发现information dropout取得了与二元dropout相当或更好的泛化性能,尤其在较小模型上,因为它能自动使噪声适应网络结构以及测试样本。

关键词

引用

@article{arxiv.1611.01353,
  title  = {Information Dropout: Learning Optimal Representations Through Noisy Computation},
  author = {Alessandro Achille and Stefano Soatto},
  journal= {arXiv preprint arXiv:1611.01353},
  year   = {2017}
}