中文

面向大规模深度学习的可扩展实用自然梯度

机器学习 2020-02-17 v1 机器学习

摘要

深度神经网络的大规模分布式训练因有效小批量大小的增加而导致模型泛化性能变差。先前的方法试图通过随轮次和层调整学习率与批量大小,或对批量归一化进行临时修改来解决此问题。我们提出可扩展实用自然梯度下降(SP-NGD),一种训练模型的原理性方法,使其能达到与一阶优化方法训练的模型相似的泛化性能,同时加速收敛。此外,与一阶方法相比,SP-NGD 扩展到大型小批量大小时计算开销可忽略不计。我们在一个有高度优化一阶方法作为参考的基准任务上评估了 SP-NGD:在 ImageNet 上训练 ResNet-50 模型用于图像分类。我们展示了使用 1,024 个 GPU、小批量大小 32,768 时在 5.5 分钟内收敛到 75.4% 的 top-1 验证准确率,以及使用极大批量大小 131,072 经 SP-NGD 873 步达到 74.9% 的准确率。

关键词

引用

@article{arxiv.2002.06015,
  title  = {Scalable and Practical Natural Gradient for Large-Scale Deep Learning},
  author = {Kazuki Osawa and Yohei Tsuji and Yuichiro Ueno and Akira Naruse and Chuan-Sheng Foo and Rio Yokota},
  journal= {arXiv preprint arXiv:2002.06015},
  year   = {2020}
}

备注

arXiv admin note: text overlap with arXiv:1811.12019