面向大型语言模型训练的分层检查点技术TierCheck
分布式、并行与集群计算
2026-05-19 v1 人工智能
摘要
大型语言模型(LLM)训练常因异构多样的失败而被中断,范围从常见的GPU崩溃到灾难性的集群级中断。现有的检查点系统依赖单层存储后端,迫使在状态保存开销和恢复速度之间做出权衡。我们提出了TierCheck,一种集群感知的分层检查点系统,将存储放置与失败异构性相匹配。TierCheck采用三层设计,在本地和同辈内存中维护轻量级差分检查点以实现快速的局部恢复,同时异步将重型基准检查点迁移到远程持久存储。它还确保在各层之间实现严格的全局一致性,而不会阻止训练,并实现快速的集群感知检查点恢复。针对最高达40亿参数的模型进行评估显示,TierCheck实现了低训练开销,将端到端检查点时间缩短至10秒以内,并支持高频率检查点,最终在低开销持久性和快速恢复之间取得最佳平衡。
引用
@article{arxiv.2605.17821,
title = {TierCheck: Tiered Checkpointing for Fault Tolerance in Large Language Model Training},
author = {Shujie Han and Feng Jiang and Patrick P. C. Lee and Xiao Zhang and Zhijie Huang and Nannan Zhao and Xiaonan Zhao and Lichen Pan},
journal= {arXiv preprint arXiv:2605.17821},
year = {2026}
}