分阶段训练加速测试误差相对于 SGD 的收敛
机器学习
2019-02-05 v3 机器学习
最优化与控制
摘要
分阶段训练策略被广泛用于神经网络学习,其以相对较大的步长(即学习率)运行随机算法(例如 SGD),并在若干次迭代后将步长几何级数减小。已观察到,就训练误差与测试误差而言,分阶段 SGD 比采用多项式衰减步长的原始 SGD 具有快得多的收敛速度。但现有研究在很大程度上忽略了如何解释这一现象。本文为解释这一更快收敛提供了一些理论依据。具体而言,我们考虑一种用于最小化经验风险的分阶段训练策略,该经验风险满足 Polyak-Łojasiewicz(PL)条件,该条件已在神经网络中被观察到/证明,且对一大类凸函数也成立。对于凸损失函数以及两类接近凸函数的“良性”非凸目标,我们建立了在 PL 条件下分阶段训练相对于原始 SGD 在训练误差与测试误差上更快的收敛。对深度残差网络分阶段学习的实验表明,其满足一类非凸性假设,因而可由我们的理论解释。作为独立兴趣点,所考虑非凸损失函数的测试误差界与维度和范数无关。
引用
@article{arxiv.1812.03934,
title = {Stagewise Training Accelerates Convergence of Testing Error Over SGD},
author = {Zhuoning Yuan and Yan Yan and Rong Jin and Tianbao Yang},
journal= {arXiv preprint arXiv:1812.03934},
year = {2019}
}
备注
More experiments on deep learning are added to verify the assumptions