中文

单位初始化梯度下降通过深度残差网络高效学习正定线性变换

机器学习 2018-06-19 v4 神经与进化计算 最优化与控制 统计理论 机器学习 统计理论

摘要

我们分析了使用深度线性神经网络逼近映射 d\Re^dd\Re^d 的函数 f(x)=Φxf(x) = \Phi x 的算法,即学习由矩阵 Θ1,...,ΘL\Theta_1,...,\Theta_L 参数化且定义为 h(x)=ΘLΘL1...Θ1xh(x) = \Theta_L \Theta_{L-1} ... \Theta_1 x 的函数 hh。我们关注在输入分布为各向同性时,通过对总体二次损失进行梯度下降来学习的算法。在初始假设 Θ1=...=ΘL=I\Theta_1 = ... = \Theta_L = I 的超额损失被一个足够小的常数所界定的情形下,我们给出了梯度下降逼近最小二乘矩阵 Φ\Phi 所需迭代次数的多项式界。另一方面,我们表明当 Φ\Phi 与单位矩阵的距离为一个较大常数时梯度下降无法收敛,并且我们表明某些在每一层向单位矩阵正则化的形式并无帮助。若 Φ\Phi 为对称正定,我们表明一个将 Θi=I\Theta_i = I 初始化的算法可使用关于 LLΦ\Phi 的条件数与 log(d/ϵ)\log(d/\epsilon) 多项式次数的更新来学习 ff 的一个 ϵ\epsilon-逼近。相比之下,我们表明若最小二乘矩阵 Φ\Phi 为对称且有一个负特征值,则一类执行单位初始化梯度下降并可选择在每一层向单位矩阵正则化的算法均无法收敛。我们分析了在 Φ\Phi 满足对所有 uuuΦu>0u^{\top} \Phi u > 0 但未必对称时的算法。该算法使用两个正则化项:一个维持不变式 uΘLΘL1...Θ1u>0u^{\top} \Theta_L \Theta_{L-1} ... \Theta_1 u > 0 对所有 uu 成立,另一个“平衡” Θ1,...,ΘL\Theta_1, ..., \Theta_L 使它们具有相同的奇异值。

关键词

引用

@article{arxiv.1802.06093,
  title  = {Gradient descent with identity initialization efficiently learns positive definite linear transformations by deep residual networks},
  author = {Peter L. Bartlett and David P. Helmbold and Philip M. Long},
  journal= {arXiv preprint arXiv:1802.06093},
  year   = {2018}
}