通过FCP unleash基座模型预训练中可扩展上下文并行的潜力
分布式、并行与集群计算
2026-05-12 v1
摘要
上下文并行(CP)已被广泛采用以支持基座模型预训练中日益增长的上下文长度,但现有设计未能处理训练数据集中序列长度的大幅变动,导致性能次优。这些方法常常会过度切分短序列,导致计算效率低下和通信过度,或在缺乏适当分箱装填的情况下分别处理长短序列,引发工作负载不均衡。本文提出FCP(Flexible Context Parallelism)范式,在块级粒度上对序列进行切分和调度。不依赖诸如环形等刚性通信拓扑,FCP实现任意点对点通信,允许序列块在工作者之间灵活布局。通过对来自短序列和长序列的块进行分箱装填,FCP实现了高计算效率和均衡的工作负载分布。广泛的评估显示,FCP在最高可达256个NVIDIA GPU上实现接近线性可扩展性,注意力MFU提升了1.13倍至2.21倍。
引用
@article{arxiv.2605.08524,
title = {Unleashing Scalable Context Parallelism for Foundation Models Pre-Training via FCP},
author = {Yilong Zhao and Xiaonan Nie and Kan Zhu and Shuang Ma and Zhichao Lai and Hongxiang Hao and Yang Zhou and Baris Kasikci and Ion Stoica},
journal= {arXiv preprint arXiv:2605.08524},
year = {2026}
}
备注
Accepted by MLSys 2026