中文

基于自动混合精度训练的编码器-解码器网络的计算、时间与能耗表征

分布式、并行与集群计算 2021-09-08 v1 机器学习

摘要

深度神经网络在许多不同领域已展现出巨大成功。这些网络的训练可能耗费大量的时间、计算与能量。随着数据集变大、模型变得更复杂,模型架构的探索变得难以承受。在本文中,我们考察了针对短期天气预报(称为降水临近预报)问题训练基于 UNet 的深度神经网络的计算、能量与时间代价。通过结合数据分布式与混合精度训练,我们探索了该问题的设计空间。我们还表明,若采用适当的优化,性能更优的更大模型可能仅带来增量式代价。我们证明,借助混合精度训练可在不牺牲模型性能的前提下显著缩短训练时间。此外,我们发现,对于具有 4 个编码层的 UNet,网络可训练参数数量增加 1549% 仅伴随相对较小的 63.22% 的能量使用增长。

关键词

引用

@article{arxiv.2008.08062,
  title  = {Compute, Time and Energy Characterization of Encoder-Decoder Networks with Automatic Mixed Precision Training},
  author = {Siddharth Samsi and Michael Jones and Mark M. Veillette},
  journal= {arXiv preprint arXiv:2008.08062},
  year   = {2021}
}

备注

Accepted for publication at IEEE HPEC 2020