面向AI的数据中心生命周期重构:一种基于总拥有成本的框架
人工智能
2025-10-01 v1 硬件体系结构
分布式、并行与集群计算
摘要
大型语言模型(LLMs)的快速崛起正在驱动对AI推理基础设施的巨大需求,主要由高端GPU提供动力。尽管这些加速器提供了巨大的计算能力,但由于频繁升级、密集的功耗和散热需求,这些加速器造成高额的资本和运营成本,使得AI数据中心的总拥有成本(TCO)成为云提供商的关键关切。不幸的是,传统的数据中心生命周期管理(旨在为通用工作负载设计)难以跟上AI快速演变的模型、日益增长的资源需求和多样化的硬件配置。在本文中,我们重新构思了AI数据中心生命周期方案,涵盖三个阶段:建设、硬件更新和运营。我们展示了在电力、散热和网络 provisioning 方面的设计选择如何影响长期TCO。我们还探讨了与硬件趋势相匹配的更新策略。最后,我们使用操作软件优化来降低成本。虽然这些在各个阶段的优化都带来了收益,但要实现全部潜力,需要重新构思整个生命周期。因此,我们提出了一个协调和 co-optimizing 所有三个阶段的整体生命周期管理框架,考虑到工作负载动态、硬件演变和系统老化。我们的系统在传统方法上通过最高可达40%降低TCO。使用我们的框架我们提供了指南,说明如何为未来管理AI数据中心生命周期。
引用
@article{arxiv.2509.26534,
title = {Rearchitecting Datacenter Lifecycle for AI: A TCO-Driven Framework},
author = {Jovan Stojkovic and Chaojie Zhang and Íñigo Goiri and Ricardo Bianchini},
journal= {arXiv preprint arXiv:2509.26534},
year = {2025}
}