勿用大迷你批,改用局部 SGD
机器学习
2020-02-18 v6 机器学习
摘要
迷你批随机梯度方法(SGD)是深度神经网络分布式训练的最先进方法。近年来,迷你批大小的急剧增大带来了关键的效率和可扩展性提升。然而,进展面临一个主要障碍,因为用大批量训练的模型往往泛化不佳,即它们在新数据上表现出较低的准确率。作为补救,我们提出了一种后局部 SGD,并表明与标准基准上的大批量训练相比,它在享有相同效率(达到特定准确率所需时间)和可扩展性的同时,显著改善了泛化性能。我们进一步对一系列局部 SGD 变体所涉及的通信效率与性能之间的权衡进行了广泛研究。
引用
@article{arxiv.1808.07217,
title = {Don't Use Large Mini-Batches, Use Local SGD},
author = {Tao Lin and Sebastian U. Stich and Kumar Kshitij Patel and Martin Jaggi},
journal= {arXiv preprint arXiv:1808.07217},
year = {2020}
}
备注
To appear in ICLR 2020