全面评估创建语言模型的环境影响
计算机与社会
2025-03-11 v1 人工智能
机器学习
摘要
随着人工智能系统性能的大幅提升,创建这些系统所带来的环境影响也随之剧增。尽管许多模型开发者会公布其最新模型最终训练运行的功耗和碳排放估算,但对于模型开发、硬件制造以及整个过程中的总用水量等影响,却缺乏相应的透明度。在本研究中,我们估算了一系列语言模型从 2000 万到 130 亿活跃参数、每个模型最高训练 5.6 万亿 token 的真实世界环境影响。在将硬件制造、模型开发和最终训练运行纳入计算后,我们发现我们发布的系列模型排放了 493 吨碳,相当于美国约 98 个家庭一年的用电量;消耗了 276.9 万升水,相当于美国一个人约 24.5 年的用水量,尽管我们的数据中心极具节水效率。我们测量并报告了模型开发的环境影响;据我们所知,我们是首个针对 LLM 进行此类报告的团队,并且我们发现模型开发(大多数模型开发者通常不披露其影响)的影响约占训练影响的 50%。通过分析功耗的详细时间序列数据,我们还发现训练过程中的功耗并不稳定,在硬件最大功率抽取的 15% 到 85% 之间波动,随着需求持续增长,这对电网级规划产生了负面影响。最后,我们讨论了估算 AI 系统环境影响持续存在的困难,并为模型开发者及公众总结了关键启示。
引用
@article{arxiv.2503.05804,
title = {Holistically Evaluating the Environmental Impact of Creating Language Models},
author = {Jacob Morrison and Clara Na and Jared Fernandez and Tim Dettmers and Emma Strubell and Jesse Dodge},
journal= {arXiv preprint arXiv:2503.05804},
year = {2025}
}
备注
ICLR 2025 (spotlight)