Taylor 化训练:在有限宽度下更好地逼近神经网络训练
机器学习
2020-02-26 v2 机器学习
摘要
我们提出 \emph{Taylor 化训练}作为在有限宽度下更好理解神经网络训练的一项举措。Taylor 化训练涉及在初始化处训练神经网络的 阶 Taylor 展开,是线性化训练——一种近期提出的用于理解深度学习成功之道的理论——的有原理依据的推广。我们在现代神经网络架构上实验了 Taylor 化训练,并表明 Taylor 化训练 (1) 随着我们增大 越来越好地吻合完整神经网络训练,且 (2) 能显著缩小线性化训练与完整训练之间的性能差距。相较于线性化训练,高阶训练在更现实的设定下奏效,例如标准参数化与大的(初始)学习率。我们以理论结果补充我们的实验,表明在宽神经网络中 阶 Taylor 化模型的逼近误差随 指数衰减。
引用
@article{arxiv.2002.04010,
title = {Taylorized Training: Towards Better Approximation of Neural Network Training at Finite Width},
author = {Yu Bai and Ben Krause and Huan Wang and Caiming Xiong and Richard Socher},
journal= {arXiv preprint arXiv:2002.04010},
year = {2020}
}