中文

基于模型架构与训练环境估算深度学习能耗

机器学习 2025-09-26 v5 计算机与社会 软件工程

摘要

为提高对深度学习(DL)环境影响的认识,许多研究估算DL系统的能源使用。然而,DL训练期间的能耗估算常依赖于未经验证的假设。本工作通过研究模型架构和训练环境如何影响能耗来弥补这一空白。我们训练了多种计算机视觉模型,并收集能耗和准确率指标,以分析它们在不同配置下的权衡。我们的结果表明,选择合适的模型-训练环境组合可减少高达80.68%的训练能耗,而F1F_1分数损失小于2%。我们发现模型与训练环境之间存在显著的交互效应:当GPU计算能力与模型复杂度成比例时,能源效率提高。此外,我们证明常见的估算做法,如使用FLOPs或GPU TDP,未能捕捉这些动态并可能导致实质性误差。为解决这些缺陷,我们提出了稳定训练周期投影(STEP)和基于预训练回归的估算(PRE)方法。在各项评估中,我们的方法在估算精度上优于现有工具两倍或更多。

关键词

引用

@article{arxiv.2307.05520,
  title  = {Estimating Deep Learning energy consumption based on model architecture and training environment},
  author = {Santiago del Rey and Luís Cruz and Xavier Franch and Silverio Martínez-Fernández},
  journal= {arXiv preprint arXiv:2307.05520},
  year   = {2025}
}

备注

48 pages, 10 figures, under review in Computer Standards & Interfaces journal. This work is an extension of arXiv:2307.05520v3 [cs.LG]