中文

AB-Training:一种用于分布式低秩学习的通信高效方法

机器学习 2024-07-02 v2 人工智能 分布式、并行与集群计算

摘要

通信瓶颈严重阻碍了分布式神经网络训练的可扩展性,特别是在高性能计算(high-performance computing, HPC)环境中。我们引入了 AB-training,这是一种新颖的数据并行方法,它利用低秩表示和独立的训练组来显著减少通信开销。我们的实验表明,在各种扩展场景下,网络流量平均减少约 70.31%,提高了通信受限系统的训练潜力,并加速了大规模收敛。AB-training 在较小规模下也表现出显著的正则化效应,在保持甚至减少训练时间的同时提高了泛化能力。我们在 CIFAR-10 上训练的 VGG16 上实现了 44.14 : 1 的惊人压缩比,且精度损失极小,并在 ImageNet-2012 上训练的 ResNet-50 上比传统数据并行训练高出 1.55%。尽管 AB-training 很有前景,但我们的研究结果也表明,即使在低秩机制下,大批量效应依然存在,这突出了进一步研究大规模分布式训练优化更新机制的必要性。

关键词

引用

@article{arxiv.2405.01067,
  title  = {AB-Training: A Communication-Efficient Approach for Distributed Low-Rank Learning},
  author = {Daniel Coquelin and Katherina Flügel and Marie Weiel and Nicholas Kiefer and Muhammed Öz and Charlotte Debus and Achim Streit and Markus Götz},
  journal= {arXiv preprint arXiv:2405.01067},
  year   = {2024}
}