中文

DASH:面向高吞吐量可重复 LLM 训练的确定性注意力调度

机器学习 2026-01-30 v1 分布式、并行与集群计算

摘要

确定性在大语言模型 (LLM) 训练中至关重要,但往往付出沉重的性能代价。在广泛使用的注意力实现如 FlashAttention-3 中,确定性反向传播相对于其非确定性对等物可高达 37.9% 的吞吐量降低,主要因为梯度累积操作必须序列化才能保证数值一致性。这种性能损失源于计算和梯度-化简阶段调度不佳,导致硬件利用率显著不足。为此,我们将注意力的反向传播建模为 DAG 上的调度问题,并推导出可最小化关键路径长度的调度方案。基于此模型,我们提出 DASH (Deterministic Attention Scheduling for High-Throughput),其包含两种互补调度策略:(i) Descending Q-Tile Iteration,一种逆 query-block 遍历,缩短因因果注意力中的管道停顿;(ii) Shift Scheduling,一种在我们 DAG 模型中的理论最优调度方案,减少全掩码和因果掩码的管道停顿。我们在 NVIDIA H800 GPU 上进行的实证评估表明,DASH 缩小了确定性注意力的性能差距。该提出的策略较基准提高注意力反向传递的吞吐量最高可达 1.28×1.28\times,显著推进了可重复 LLM 训练的效率。我们的代码已开源于 https://github.com/SJTU-Liquid/deterministic-FA3。

关键词

引用

@article{arxiv.2601.21824,
  title  = {DASH: Deterministic Attention Scheduling for High-throughput Reproducible LLM Training},
  author = {Xinwei Qiang and Hongmin Chen and Shixuan Sun and Jingwen Leng and Xin Liu and Minyi Guo},
  journal= {arXiv preprint arXiv:2601.21824},
  year   = {2026}
}