中文

Chameleon:基于实时策略选择的分布式训练自适应容错

分布式、并行与集群计算 2026-04-21 v4

摘要

大型语言模型训练面临各种故障导致的频繁中断,亟需鲁棒的容错机制。现有无备份方法,如冗余计算、动态并行和数据路由,每种方法都会带来性能惩罚,无论是持续开销、 lengthy reconfigurations,还是恢复后不效率。我们提出 Chameleon,一种自适应容错系统,通过智能选择故障发生时的最优恢复策略来实现此目标。Chameleon 通过统一的性能模型、快速的执行计划搜索、准确的性能估计和高效的通信优化实现上述目标。在 32 卡集群上进行实验表明,Chameleon 在恢复后与故障自由训练之间保持 11.00% 以内的性能差距,同时保持模型收敛和高效的内存使用。与最新方法相比,Chameleon 分别比 Oobleck 和 Recycle 平均吞吐量分别提高了 1.229 倍和 1.355 倍。

关键词

引用

@article{arxiv.2508.21613,
  title  = {Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection},
  author = {Yuhang Zhou and Zhibin Wang and Peng Jiang and Haoran Xia and Junhe Lu and Qianyu Jiang and Rong Gu and Hengxi Xu and Xinjing Huang and Guanghuan Fang and Zhiheng Hu and Jingyi Zhang and Yongjin Cai and Jian He and Chen Tian},
  journal= {arXiv preprint arXiv:2508.21613},
  year   = {2026}
}