中文

利用集体低精度与结构化压缩最小化深度学习硬件设计的面积与能耗

神经与进化计算 2018-04-23 v1

摘要

深度学习算法在许多识别任务中取得了巨大成功;然而,这些算法通常包含深度神经网络(DNN)结构和大量参数,难以在功耗/面积受限的嵌入式平台上实现。为减小网络规模,若干研究通过剪枝和正则化引入逐元素或行/列/块级稀疏性来进行压缩。此外,许多近期工作聚焦于降低激活值与权重的精度,部分甚至降至单比特。然而,将各类稀疏结构与二值化或极低精度(2–3 比特)神经网络结合尚未被全面探索。本工作中,我们提出以精度退化最小为前提、面积/能耗最小的 DNN 硬件设计技术。训练过程中,将二值化/低精度与结构化稀疏性同时作为约束,以给定深度学习算法求得最小内存占用。在 CIFAR-10 数据集上权重内存缩减 50 倍的 DNN 模型取得了与浮点模型相当的精度。针对 MNIST 数据集给出了 40nm CMOS 下 DNN 硬件的面积、性能与能耗结果。结合 8 倍结构化压缩与 3 比特权重精度的优化 DNN 在每次分类 20nJ 下达到了 98.4% 的精度。

关键词

引用

@article{arxiv.1804.07370,
  title  = {Minimizing Area and Energy of Deep Learning Hardware Design Using Collective Low Precision and Structured Compression},
  author = {Shihui Yin and Gaurav Srivastava and Shreyas K. Venkataramanaiah and Chaitali Chakrabarti and Visar Berisha and Jae-sun Seo},
  journal= {arXiv preprint arXiv:1804.07370},
  year   = {2018}
}

备注

2017 Asilomar Conference on Signals, Systems and Computers