中文

Taylor 化训练:在有限宽度下更好地逼近神经网络训练

机器学习 2020-02-26 v2 机器学习

摘要

我们提出 \emph{Taylor 化训练}作为在有限宽度下更好理解神经网络训练的一项举措。Taylor 化训练涉及在初始化处训练神经网络的 kk 阶 Taylor 展开,是线性化训练——一种近期提出的用于理解深度学习成功之道的理论——的有原理依据的推广。我们在现代神经网络架构上实验了 Taylor 化训练,并表明 Taylor 化训练 (1) 随着我们增大 kk 越来越好地吻合完整神经网络训练,且 (2) 能显著缩小线性化训练与完整训练之间的性能差距。相较于线性化训练,高阶训练在更现实的设定下奏效,例如标准参数化与大的(初始)学习率。我们以理论结果补充我们的实验,表明在宽神经网络中 kk 阶 Taylor 化模型的逼近误差随 kk 指数衰减。

关键词

引用

@article{arxiv.2002.04010,
  title  = {Taylorized Training: Towards Better Approximation of Neural Network Training at Finite Width},
  author = {Yu Bai and Ben Krause and Huan Wang and Caiming Xiong and Richard Socher},
  journal= {arXiv preprint arXiv:2002.04010},
  year   = {2020}
}