中文

DaiFu:深度学习系统的现场崩溃恢复

软件工程 2025-07-03 v1

摘要

深度学习(DL)系统已在众多领域广泛采用,并因大型语言模型的兴起而愈发受欢迎。然而,由于其开发和执行中涉及复杂的软件堆栈,崩溃是不可避免且常见的。崩溃严重浪费计算资源并阻碍开发生产力,因此高效的崩溃恢复至关重要。现有解决方案如checkpoint-retry方式,对因轻微编程错误或暂时性运行时错误导致的崩溃恢复过于笨重。因此,本文提出DaiFu,一种针对深度学习系统的现场恢复框架。通过对给定DL系统进行轻量级代码转换,DaiFu增强了其现场拦截崩溃的能力,使其能够动态且即时地更新其程序运行上下文(如代码、配置和其他数据),实现敏捷的崩溃恢复。我们的评估表明,DaiFu帮助减少了崩溃恢复的恢复时间,相较于最先进的解决方案实现了1372倍的加速。同时,DaiFu的开销可忽略不计(低于0.40%)。我们还构建了一个覆盖深度学习系统中7种不同崩溃情景的基准,展示了DaiFu在多种情形下的有效性。

关键词

引用

@article{arxiv.2507.01628,
  title  = {DaiFu: In-Situ Crash Recovery for Deep Learning Systems},
  author = {Zilong He and Pengfei Chen and Hongyu Zhang and Xiaoyun Li and Guangba Yu and Hongyang Chen and Zibin Zheng},
  journal= {arXiv preprint arXiv:2507.01628},
  year   = {2025}
}