将门控与线性解耦
机器学习
2019-06-13 v1 机器学习
摘要
ReLU神经网络是许多近期理论工作的焦点,试图解释其经验成功。尽管如此,即便在浅层(单隐藏层)网络的情况下,当前理论结果与经验观测之间仍存在差距。例如,在记忆大小为、维度为的随机样本的任务中,最佳理论结果要求网络规模为,而经验上规模略大于的网络即已足够。为弥合此差距,我们转而研究ReLU网络的简化模型。我们观察到,ReLU神经元是线性函数与门控(后者决定神经元是否激活)的乘积,二者共享联合训练的权重向量。本着这一精神,我们引入了门控线性单元(Gated Linear Unit,GaLU),它简单地通过为每个角色分配不同向量而将线性与门控解耦。我们表明,GaLU网络使我们能够获得比ReLU网络现有结果强得多的优化和泛化结果。具体而言,我们给出了规模为的网络记忆结果,以及改进的泛化界。最后,我们表明在某些场景中,GaLU网络表现与ReLU网络相似,从而证明是简化模型的良好选择。
引用
@article{arxiv.1906.05032,
title = {Decoupling Gating from Linearity},
author = {Jonathan Fiat and Eran Malach and Shai Shalev-Shwartz},
journal= {arXiv preprint arXiv:1906.05032},
year = {2019}
}