中文

迈向对独立子网络训练的更好理论理解

机器学习 2024-06-05 v2 分布式、并行与集群计算 最优化与控制

摘要

现代大规模机器学习的进展离不开数据并行分布式计算这一范式。由于大规模模型的分布式计算给通信信道带来了过大压力,近期大量研究致力于协同设计通信压缩策略与训练算法,以降低通信成本。纯数据并行虽能更好地实现数据扩展,却存在模型扩展性能差的问题。事实上,计算节点受到内存限制的严重制约,阻碍了模型规模的进一步扩大。为此,训练巨型神经网络模型的最新成果也依赖于某种形式的模型并行。本文从理论角度深入审视独立子网络训练(Independent Subnetwork Training, IST),这是一种近期提出且极为有效地解决上述问题的技术。我们指出了 IST 与替代方法(如带压缩通信的分布式方法)之间的本质差异,并精确分析了其在二次模型上的优化性能。

关键词

引用

@article{arxiv.2306.16484,
  title  = {Towards a Better Theoretical Understanding of Independent Subnetwork Training},
  author = {Egor Shulgin and Peter Richtárik},
  journal= {arXiv preprint arXiv:2306.16484},
  year   = {2024}
}

备注

Accepted to International Conference on Machine Learning (ICML), 2024