中文

分布式 DNN 训练的端到端建模综述:工作负载、模拟器与 TCO

分布式、并行与集群计算 2025-06-12 v1

摘要

分布式深度神经网络 (DNN) 已成为扩展机器学习以满足日益复杂应用需求的核心技术。然而,模型复杂度的快速增长远远超过了 CMOS 技术的扩展速度,这使得可持续且高效的系统设计变得至关重要。要解决这一问题,需在软件、硬件和技术层面进行协调的协同设计。由于部署大规模训练系统的成本和复杂度高昂,模拟器在促进这一设计探索方面发挥着关键作用。本综述审查了分布式 DNN 训练模拟器的格局,聚焦三个主要维度:工作负载表示、模拟基础设施以及总拥有成本 (TCO) 包括碳排放的模型。本综述涵盖了工作负载如何被抽象化并用于模拟、概述了常见的工作负载表示方法,并包括涵盖两种模拟框架和 TCO/排放模型的全面比较表格,详细说明其能力、假设以及关注范围。除了综合现有工具外,本综述还概述了新兴趋势、常见局限性以及整个技术栈中的开放研究挑战。通过提供结构化的概览,本工作支持在分布式训练系统的设计与评估方面进行明智的决策。

关键词

引用

@article{arxiv.2506.09275,
  title  = {A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO},
  author = {Jonas Svedas and Hannah Watson and Nathan Laubeuf and Diksha Moolchandani and Abubakr Nada and Arjun Singh and Dwaipayan Biswas and James Myers and Debjyoti Bhattacharjee},
  journal= {arXiv preprint arXiv:2506.09275},
  year   = {2025}
}