中文

通过计数草图压缩梯度优化器

机器学习 2019-02-27 v2 数据结构与算法 机器学习

摘要

许多流行的一阶优化方法(如Momentum、AdaGrad、Adam)加速了深度学习模型的收敛速率。然而,这些算法需要辅助参数,其额外内存开销与模型参数数量成正比。随着深度学习模型为从复杂大规模数据集学习而持续变大,该问题日益严重。我们提出的解决方案是维护一个线性草图来压缩辅助变量。我们证明,我们的技术在性能上与全尺寸基线相当,同时大幅减少辅助变量所占空间。理论上,我们证明计数草图优化保持SGD收敛速率,同时优雅地降低大模型的内存使用。在大规模1-Billion Word数据集上,我们通过压缩Embedding和Softmax层中的Adam优化器,以可忽略的精度和性能损失节省了训练期间25%的内存(8.6 GB而非11.7 GB)。对于具有超过4950万类的亚马逊极端分类任务,我们通过使用计数草图优化器将mini-batch大小增加3.5倍,还将训练时间减少了38%。

关键词

引用

@article{arxiv.1902.00179,
  title  = {Compressing Gradient Optimizers via Count-Sketches},
  author = {Ryan Spring and Anastasios Kyrillidis and Vijai Mohan and Anshumali Shrivastava},
  journal= {arXiv preprint arXiv:1902.00179},
  year   = {2019}
}

备注

Initially submitted to WWW 2019 (November 2018)