深度网络为何可逆:一个简单理论及其对训练的启示
机器学习
2015-11-23 v2
摘要
深度学习的生成模型大有前景,既可增进对模型的理解,又能产生所需标记样本更少的训练方法。近期工作使用生成模型方法,在给定上方数层的隐藏层取值时生成深度网络的输入。然而,这些生成模型缺乏相应的“正确性证明”,即证明前馈深度网络是在给定输入时恢复隐藏层的正确推断方法。此外,这些模型复杂。本文采取更理论化的路径。其提出了一个针对RELU深度网络的极简生成模型,具有以下特征:(i) 生成模型恰为前馈网络的逆:若某层前向变换为则逆向变换为。(这可视为对去噪自编码器的旧权重捆绑思想的解释。)(ii) 其正确性可在一个干净的理论假设下得证:现实深度网络中的边权表现如同随机数。在此假设下——该假设在AlexNet等现实网络上经实验检验——形式化证明了前馈网络是恢复隐藏层的正确推断方法。该生成模型提示了一种简单的训练修改:利用生成模型产生带标签的合成数据并纳入训练集。实验展示了对类随机深度网络这一理论的支持;且表明其有助于训练。
引用
@article{arxiv.1511.05653,
title = {Why are deep nets reversible: A simple theory, with implications for training},
author = {Sanjeev Arora and Yingyu Liang and Tengyu Ma},
journal= {arXiv preprint arXiv:1511.05653},
year = {2015}
}