中文

探索 Hugging Face 机器学习模型的碳足迹:一项仓库挖掘研究

机器学习 2023-12-01 v3 计算机与社会 信息检索 机器学习

摘要

随着机器学习(ML)系统能力增强与模型规模扩大,其碳足迹也因之加剧。然而,关于 ML 模型碳足迹如何被实际测量、报告与评估的认知仍十分匮乏。有鉴于此,本文旨在分析 Hugging Face(最流行的预训练 ML 模型仓库)上 1,417 个 ML 模型及相关数据集的碳足迹测量情况,以提供关于如何报告与优化 ML 模型碳效率的见解与建议。该研究包含首项基于 Hugging Face Hub API 针对碳排放的仓库挖掘研究。本研究试图回答两个研究问题:(1)ML 模型创建者如何在 Hugging Face Hub 上测量并报告碳排放?以及(2)哪些因素影响训练 ML 模型的碳排放?研究得出若干关键发现:碳足迹报告模型的比例停滞不前;过去两年 Hugging Face 上报告的碳足迹略有下降;NLP 作为主导应用域持续占据主流。此外,研究揭示了碳排放与模型规模、数据集规模及 ML 应用域等多种属性间的相关性。这些结果凸显了改进能耗报告实践、在 Hugging Face 社区内推动碳高效模型开发的软件度量需求。针对该问题,本文提出两种分类:一种按碳足迹报告实践对模型分类,另一种按碳效率分类。这些分类提议旨在促进 ML 社区内的透明性与可持续模型开发。

关键词

引用

@article{arxiv.2305.11164,
  title  = {Exploring the Carbon Footprint of Hugging Face's ML Models: A Repository Mining Study},
  author = {Joel Castaño and Silverio Martínez-Fernández and Xavier Franch and Justus Bogner},
  journal= {arXiv preprint arXiv:2305.11164},
  year   = {2023}
}

备注

Accepted at the 2023 ACM/IEEE International Symposium on Empirical Software Engineering and Measurement (ESEM)