大型预训练神经网络的能耗考量
机器学习
2025-06-03 v1
摘要
日益复杂的神经网络架构取得了惊人的性能。然而,这些复杂模型需要消耗大量电力的海量计算资源,凸显了此类模型对环境的潜在影响。先前的研究表明,大型预训练模型中存在大量冗余。然而,先前的工作主要集中在压缩模型的同时保持相当的模型性能,而对电力消耗的直接影响似乎鲜受关注。通过量化未压缩模型和压缩模型的能源使用量,我们将压缩作为减少电力消耗的手段进行研究。我们考虑了九种不同的预训练模型,参数规模从 8M 到 138M 不等。为建立基线,我们首先在不进行压缩的情况下训练每个模型,并记录训练期间的电力使用量、所需时间以及其他相关统计数据。随后,我们应用三种压缩技术:隐写容量缩减、剪枝和低秩分解。在得到的每个结果案例中,我们再次测量电力使用量、训练时间、模型准确率等。我们发现,剪枝和低秩分解在能源使用量或其他相关统计指标方面没有显著改善,而隐写容量缩减在几乎所有情况下都提供了显著益处。我们讨论了这些发现的意义。
引用
@article{arxiv.2506.01311,
title = {Energy Considerations for Large Pretrained Neural Networks},
author = {Leo Mei and Mark Stamp},
journal= {arXiv preprint arXiv:2506.01311},
year = {2025}
}