转换、压缩、纠错:迈向通信高效DNN训练的三步
机器学习
2022-03-18 v1
摘要
本文中,我们引入一种新颖算法,用于通信高效的分布式深度神经网络(DNN)训练。是一种联合训练/通信协议,涵盖对网络梯度的三个处理步骤:(i)通过浮点转换进行量化,(ii)无损压缩,以及(iii)纠错。这三个组件在速率受限链路上的分布式DNN训练实现中至关重要。这三个步骤在处理DNN梯度时的相互作用被仔细平衡,以产生一种鲁棒且高性能的方案。所提方案的性能通过CIFAR-10上的数值评估进行了研究。
引用
@article{arxiv.2203.09044,
title = {Convert, compress, correct: Three steps toward communication-efficient DNN training},
author = {Zhong-Jing Chen and Eduin E. Hernandez and Yu-Chih Huang and Stefano Rini},
journal= {arXiv preprint arXiv:2203.09044},
year = {2022}
}