中文

TACO:面向可扩展张量并行大语言模型训练的中间张量高效通信压缩

数值分析 2026-04-28 v1 数值分析

摘要

在大规模张量并行训练中处理通信开销 remains 一个关键挑战,因为中间张量呈现稠密且接近零的分布,这在频繁通信下会加剧误差,并在压缩期间引入显著的计算开销。为此,我们提出 TACO(Tensor-parallel Adaptive COmmunication compression),一个基于 FP8 的稳健框架,用于压缩 TP 中间张量。首先,我们采用数据驱动的重塑策略结合自适应尺度-Hadamard 变换,以实现高保真度 FP8 量化,同时其双尺度量化机制确保训练期间的数值稳定性。其次,我们设计高度融合的压缩算子,以减少内存流量和内核启动开销,实现与通信的高效重叠。最后,我们将 TACO 与现有最先进的数据和管道并行方法集成,开发了一个启用压缩的 3D 并行训练框架。在 GPT 模型和 Qwen 模型上的详细实验表明,TACO 实现了最高可达 1.87 倍的端到端吞吐量提升,同时保持接近无损的准确性,验证了 TACO 在大规模训练中的有效性与效率。

关键词

引用

@article{arxiv.2604.24087,
  title  = {Submatrices with the best-bounded inverses: an asymptotically tight upper bound for $\mathbb{C}^{n \times 2}$},
  author = {Yuri Nesterenko},
  journal= {arXiv preprint arXiv:2604.24087},
  year   = {2026}
}