中文

LLMCarbon:建模大语言模型的端到端碳足迹

计算与语言 2024-01-22 v2 人工智能 计算机与社会 机器学习

摘要

与大语言模型(LLM)相关的碳足迹是一个重要关切,涵盖其训练、推理、实验与存储过程(包括运营与隐含碳排放)的排放。一个关键方面是在新兴 LLM 训练之前甚至就能准确估算其碳影响,这在很大程度上依赖于 GPU 的使用。现有研究已报道了 LLM 训练的碳足迹,但只有一个工具 mlco2 能在物理训练前预测新神经网络的碳足迹。然而,mlco2 存在若干严重局限:它无法将估算扩展到稠密或混合专家(MoE)LLM,忽略关键的架构参数,仅关注 GPU,且无法建模隐含碳足迹。为弥补这些不足,我们引入 \textit{\carb},一个为稠密与 MoE LLM 设计的端到端碳足迹预测模型。与 mlco2 相比,\carb~显著提升了各类 LLM 碳足迹估算的准确性。源代码发布于 \url{https://github.com/SotaroKaneda/MLCarbon}。

关键词

引用

@article{arxiv.2309.14393,
  title  = {LLMCarbon: Modeling the end-to-end Carbon Footprint of Large Language Models},
  author = {Ahmad Faiz and Sotaro Kaneda and Ruhan Wang and Rita Osi and Prateek Sharma and Fan Chen and Lei Jiang},
  journal= {arXiv preprint arXiv:2309.14393},
  year   = {2024}
}

备注

15 pages, 8 figures