中文

面向分布式深度学习的自然压缩

机器学习 2022-09-07 v3 最优化与控制 机器学习

摘要

现代深度学习模型常常在分布式机器集合上并行训练以缩短训练时间。在此类设置中,机器间模型更新的通信成为显著的性能瓶颈,已有多种有损更新压缩技术被提出以缓解该问题。本文中,我们引入一种新颖、简单但在理论与实践中均有效的压缩技术:自然压缩(NC)。我们的技术对待压缩更新向量的所有分量分别施加,通过随机舍入到最近的(负或正)2的幂次来工作,这可通过忽略尾数以“自然”方式计算。我们证明,与不压缩相比,NC使压缩向量的二阶矩增加不超过微小因子 98\frac{9}{8},这意味着NC对分布式SGD等流行训练算法的收敛速度影响可忽略。然而,NC带来的通信节省十分可观,使整体理论运行时间提升 33-4×4\times。对于需要更激进压缩的应用,我们将NC推广到自然抖动(natural dithering),并证明其在指数级上优于常见的随机抖动技术。我们的压缩算子可单独使用,也可与现有算子结合以产生更激进的组合效果,并在理论与实践上均达到新的SOTA。

关键词

引用

@article{arxiv.1905.10988,
  title  = {Natural Compression for Distributed Deep Learning},
  author = {Samuel Horvath and Chen-Yu Ho and Ludovit Horvath and Atal Narayan Sahu and Marco Canini and Peter Richtarik},
  journal= {arXiv preprint arXiv:1905.10988},
  year   = {2022}
}

备注

Proceedings of 3${}^{\text{rd}}$ Annual Conference on Mathematical and Scientific Machine Learning (MSML 2022)