门控神经网络中的学习
机器学习
2020-06-19 v2 机器学习
摘要
门控是现代神经网络(包括 LSTM、GRU 和稀疏门控深度神经网络)的一个关键特征。此类门控网络的主干是混合专家层,其中若干专家作出回归决策,而门控以输入依赖的方式控制如何对这些决策加权。尽管在经典与当代机器学习中均扮演如此突出的角色,人们对混合专家的参数恢复知之甚少,因为已知梯度下降与 EM 算法在此类模型中会陷入局部最优。在本文中,我们仔细分析优化景观,并表明借助适当设计的损失函数,梯度下降确实可以准确学习参数。支撑我们结果的一个关键思想是设计两个截然不同的损失函数,一个用于恢复专家参数,另一个用于恢复门控参数。我们展示了针对该模型中任意算法的参数恢复的首个样本复杂度结果,并在数值实验中展示了相对于标准损失函数的显著性能提升。
引用
@article{arxiv.1906.02777,
title = {Learning in Gated Neural Networks},
author = {Ashok Vardhan Makkuva and Sewoong Oh and Sreeram Kannan and Pramod Viswanath},
journal= {arXiv preprint arXiv:1906.02777},
year = {2020}
}