DeToNATION: 面向联结在线节点的解耦 Torch 网络感知训练
机器学习
2025-11-18 v4 人工智能
摘要
训练大型神经网络模型需要大量计算资源,常常分布在多个节点和加速器上。最近的研究表明,仅交换梯度的快速移动组件即可,同时在本地累积动量(解耦动量,DeMo)可能足够。然而,DeMo 假设模型适合单个加速器。我们放宽了这一假设,引入FlexDeMo,使节点在不同加速器之间对模型参数进行完全分片,同时通过仅同步快速移动组件来减少节点间通信—— resulting in a 混合分片数据并行训练策略。我们进一步引入了一个框架,称为DeToNATION,概括了DeMo、FlexDeMo以及其他流行的分布式训练方案如DiLoCo——引入新的复制方案和挑战DeMo中的选择。我们的结果在语言和视觉领域显示,FlexDeMo在类似采用AdamW和完整梯度同步的混合分片数据并行训练中达到与之相同的验证损失,同时显著更快。FlexDeMo因此是最大机器学习模型的有前景的分布式训练方案。
引用
@article{arxiv.2502.06728,
title = {DeToNATION: Decoupled Torch Network-Aware Training on Interlinked Online Nodes},
author = {Mogens Henrik From and Jacob Nielsen and Lukas Galke Poech and Peter Schneider-Kamp},
journal= {arXiv preprint arXiv:2502.06728},
year = {2025}
}
备注
Accepted as a paper at AAAI 2026 Main Track