多轮训练为何有效?
机器学习
2021-05-14 v1
摘要
随机梯度下降(SGD)因其简单性、每步更新的低计算成本以及良好的性能,已成为训练大规模深度神经网络中最具吸引力的优化方法。标准的超额风险界表明,SGD 只需对训练数据遍历一遍,更多遍遍历无助于提升性能。在经验上,人们观察到 SGD 对训练数据遍历多遍(多遍 SGD)比仅遍历一遍(单遍 SGD)具有好得多的超额风险界性能。然而,如何从理论上解释这一现象尚不十分清楚。本文为解释在特定情形下多遍遍历训练数据为何能提升性能提供了一些理论依据。具体而言,我们考虑目标函数为非凸最小二乘损失的平滑风险最小化问题。在 Polyak-Lojasiewicz(PL)条件下,我们建立了多遍 SGD 比单遍 SGD 更快的超额风险界收敛速率。
引用
@article{arxiv.2105.06015,
title = {Why Does Multi-Epoch Training Help?},
author = {Yi Xu and Qi Qian and Hao Li and Rong Jin},
journal= {arXiv preprint arXiv:2105.06015},
year = {2021}
}