中文

一种用于深度学习能耗标度律的晶体管操作模型

机器学习 2022-08-11 v2 人工智能 硬件体系结构

摘要

深度学习(DL)已变革了众多行业的自动化,并在社会中日益普及。DL 模型的高复杂度及其广泛采用导致全球能耗每 3-4 个月翻一番。目前,DL 模型配置与能耗之间的关系尚未明确建立。在通用计算能耗模型层面,其既强烈依赖于硬件架构(例如具有不同内部组件配置的通用处理器——CPU 和 GPU,可编程集成电路——FPGA),也依赖于不同的交互能耗方面(例如数据移动、计算、控制)。在 DL 模型层面,我们需要将非线性激活函数及其与数据的交互转化为计算任务。当前方法主要将非线性 DL 模型线性化,以近似其理论 FLOPs 和 MACs 作为能耗的代理。然而,由于许多卷积神经网络(CNNs)的高度非线性本质,这并不准确(估计 93% 精度)。在本文中,我们开发了底层的晶体管操作(TOs)方法,以揭示非线性激活函数和神经网络结构在能耗中的作用。我们将一系列前馈和 CNN 模型转化为 ALU 计算任务,进而转化为 TO 步骤。随后通过回归模型将其与不同硬件配置和数据集下的真实能耗值进行统计关联。我们表明,所提 TOs 方法在预测能耗方面可达到 93.61%–99.51% 的精度。

关键词

引用

@article{arxiv.2205.15062,
  title  = {A Transistor Operations Model for Deep Learning Energy Consumption Scaling Law},
  author = {Chen Li and Antonios Tsourdos and Weisi Guo},
  journal= {arXiv preprint arXiv:2205.15062},
  year   = {2022}
}

备注

15 pages, 11 figures