CarbonScaling:扩展大型语言模型碳足迹的神经尺度定律
计算与语言
2026-05-19 v2 人工智能
计算机与社会
分布式、并行与集群计算
机器学习
摘要
大型语言模型(LLM)日益遵循神经尺度定律,将性能提升与快速扩大的计算预算相联系,引发对前沿规模训练可持续性的担忧。现有的碳排放估计方法主要依赖历史运行数据的回归,无法捕捉硬件异构性、分布式并行、通信开销以及架构稀疏性等关键系统级因素。我们提出了CarbonScaling,一个面向前沿LLM训练的硬件感知分析框架,用于建模碳尺度行为。该框架集成了神经尺度定律、分布式训练策略、加速器和互联建模,以及运营碳和象征性碳会计,以估算可行的硬件配置及其相关排放。CarbonScaling联合建模了张量、管道、数据和专家并行,同时纳入了内存、带宽、利用率和运行时约束。实验验证表明,与基于回归的基线方法相比,CarbonScaling在保真度上显著提升,突显了千亿参数规模下象征性碳的日益重要性。源代码:https://github.com/UnchartedRLab/CarbonScaling。
引用
@article{arxiv.2508.06524,
title = {CarbonScaling: Extending Neural Scaling Laws for Carbon Footprint in Large Language Models},
author = {Lei Jiang and Fan Chen},
journal= {arXiv preprint arXiv:2508.06524},
year = {2026}
}
备注
8 pages