部分同步激活的张量并行
机器学习
2025-12-02 v2
摘要
大型语言模型 (LLM) 的张量并行训练和推理需要大量通信来同步激活。我们的研究表明,通过对当前实践的少数微小调整,LLM 可在不完全同步激活的情况下进行训练,从而降低带宽需求。我们将其命名为 "通信感知张量并行架构" (CAAT-Net)。我们训练了一个 7B 参数的 CAAT-Net 模型,表明张量并行通信可在几乎所有评估基准测试中降低最高 50%,且预训练准确率几乎不受影响。我们还对 130M 和 1.1B 的较小模型进行实验,显示该方法的鲁棒性和可扩展性。在某些情况下,降低通信甚至可能改善验证损失。最后,我们展示了 CAAT-Net 在各种设置和模型规模下加速训练和推理工作负载。
引用
@article{arxiv.2506.19645,
title = {Tensor-Parallelism with Partially Synchronized Activations},
author = {Itay Lamprecht and Asaf Karnieli and Yair Hanani and Niv Giladi and Daniel Soudry},
journal= {arXiv preprint arXiv:2506.19645},
year = {2025}
}