中文

LUMION:使用可编程光交换结构实现ML作业的快速故障恢复

机器学习 2025-10-07 v2 网络与互联网体系结构

摘要

当现代机器学习数据中心中的加速器发生故障时,操作员会将受影响的机器学习训练或推理作业迁移到全新的机架上。这种方法虽然保持了网络性能,但效率极低,要求数据中心保留整架空闲加速器以实现容错。在本文中,我们通过引入LUMION来解决这种资源低效问题,这是一种用于连接数据中心机架内加速器的新型可重构光交换结构。LUMION不迁移整个机器学习作业,而是在发生故障时动态将备用加速器整合到正在运行的工作负载中,从而在没有高昂迁移成本的情况下保持一致的性能。我们通过构建端到端硬件原型展示了LUMION的优势。我们的实验对Llama 3.2进行了微调,并表明LUMION在故障发生后约1秒内即可用健康的GPU替换故障GPU并重启机器学习作业。与传统的电气机架相比,在用备用加速器替换故障加速器后,LUMION实现了更高的GPU间带宽,使微调吞吐量提升了近2倍。

关键词

引用

@article{arxiv.2505.23105,
  title  = {LUMION: Fast Fault Recovery for ML Jobs Using Programmable Optical Fabrics},
  author = {Abhishek Vijaya Kumar and Eric Ding and Arjun Devraj and Darius Bunandar and Rachee Singh},
  journal= {arXiv preprint arXiv:2505.23105},
  year   = {2025}
}

备注

Content is now a part of the updated manuscript at arXiv:2508.03674