中文

使用 Parquet 数据集格式和混合精度训练改进回归模型的机器学习碳足迹——第二部分

机器学习 2024-09-23 v2 人工智能

摘要

这是我硕士论文的第二部分,比较了在训练回归 ML 模型时,使用逗号分隔值 (CSV) 和 Parquet 数据集格式以及默认浮点 (32位) 和 Nvidia 混合精度 (16位和32位) 的功耗。使用了与第一部分相同的定制 PC(专用于分类测试和分析),并选择了不同的 ML 超参数,如批量大小、神经元数量和周期数,来构建深度神经网络 (DNN)。使用 DNN 的默认超参数值进行基准测试作为参考,而实验则使用了不同设置的组合。结果记录在 Excel 中,并选择描述性统计来计算组间均值,并使用图表和表格进行比较。当混合精度与特定超参数结合使用时,结果是积极的。与基准测试相比,优化回归模型将功耗降低了 7 到 11 瓦。回归结果表明,虽然混合精度有助于改善功耗,但我们必须仔细考虑超参数。大量的批量大小和神经元会对功耗产生负面影响。然而,这项研究需要推断性统计,特别是 ANOVA 和 T 检验,来比较均值之间的关系。结果显示回归测试中均值之间没有统计显著性,并接受了 H0。因此,选择不同的 ML 技术和 Parquet 数据集格式不会改善计算功耗和整体 ML 碳足迹。然而,使用 GPU 集群进行更大规模的实现可以显著增加样本量,这是一个重要因素,并且可以改变统计分析的结果。

关键词

引用

@article{arxiv.2409.11071,
  title  = {Improve Machine Learning carbon footprint using Parquet dataset format and Mixed Precision training for regression models -- Part II},
  author = {Andrew Antonopoulos},
  journal= {arXiv preprint arXiv:2409.11071},
  year   = {2024}
}

备注

35 pages, 16 tables, 19 figures. arXiv admin note: substantial text overlap with arXiv:2409.07853