平滑矩阵胜过平滑常数:分布式优化中更优的通信压缩技术
机器学习
2021-02-16 v1 最优化与控制
摘要
大规模分布式优化已成为训练具有大量参数和训练数据的监督机器学习模型的默认工具。该领域近期的进展提供了若干加速训练的机制,包括压缩通信、方差缩减和加速。然而,这些方法均无法利用局部损失中超越标准平滑常数的、固有的丰富数据相关平滑结构。在本文中,我们主张在训练监督模型时,平滑矩阵—— ubiquitous 平滑常数的信息丰富泛化——能够在理论与实践中被利用以实现进一步的显著收益。为了进一步缓解分布式优化中固有的通信负担,我们提出了一种新颖的通信稀疏化策略,该策略可充分利用与局部损失相关的平滑矩阵。为展示该工具的威力,我们描述了如何将我们的稀疏化技术适配于三种分布式优化算法——DCGD、DIANA 和 ADIANA——从而在通信复杂度方面带来显著节省。新方法始终优于基线方法,且往往优势明显。
引用
@article{arxiv.2102.07245,
title = {Smoothness Matrices Beat Smoothness Constants: Better Communication Compression Techniques for Distributed Optimization},
author = {Mher Safaryan and Filip Hanzely and Peter Richtárik},
journal= {arXiv preprint arXiv:2102.07245},
year = {2021}
}
备注
59 pages, 5 figues, 6 tables