面向NVIDIA、AMD及新兴GPU架构的可持续AI训练:硬件软件协同设计
硬件体系结构
2025-08-20 v1 人工智能
分布式、并行与集群计算
机器学习
摘要
大规模深度学习和人工智能模型训练耗费大量计算资源和能源,构成严峻的可持续发展挑战。模型复杂度的快速提升导致能源消耗呈指数级增长,加剧了寻求计算效率最大化和降低环境影响的需求。本文探索了面向NVIDIA、AMD及其他新兴GPU架构的环境驱动性能优化方法。我们的主要关注点是针对硬件-软件协同设计技术,以显著提升内存层面和内核层面的运算效率,从而改善性能-功耗比。我们的深入研究涵盖了专用张量和矩阵核心、先进的内存优化方法以及创新的集成方案,综合而成显著提升能源效率。我们还讨论了增强硬件能力的软件级优化,包括混合精度算术、先进的能源感知调度算法以及编译器驱动的内核增强。此外,我们系统性地指出了重要的研究空白并提出了必要的未来方向,以构建真正可持续的人工智能系统。本文强调,通过硬件和软件的协同设计可获得显著的训练效率提升,从而在不牺牲性能的前提下降低人工智能的环境影响。为支撑我们的分析,我们使用来自Meta、Google、Amazon等顶尖公司的真实世界案例研究,展示了这些可持续AI训练方法在实际中的应用。
引用
@article{arxiv.2508.13163,
title = {Sustainable AI Training via Hardware-Software Co-Design on NVIDIA, AMD, and Emerging GPU Architectures},
author = {Yashasvi Makin and Rahul Maliakkal},
journal= {arXiv preprint arXiv:2508.13163},
year = {2025}
}
备注
IEEE CISOSE Industry Track 2025 Conference