论深度神经网络处理器阵列设计的困难性
硬件体系结构
2020-06-26 v1 机器学习
摘要
脉动阵列是一种有前景的计算概念,尤其契合CMOS技术趋势以及人工神经网络处理中的线性代数运算。此类深度学习方法在广泛应用中的近期成功催生了多种模型;尽管它们基于卷积与全连接层在概念上相似,但由于巨大的设计空间,其细节操作呈现高度多样性:操作数的维度差异显著,因其依赖于感受野大小、特征数、步长、膨胀与特征分组等设计原则。近来,ResNet或DenseNet等网络通过多种连接性扩展了先前单纯的前馈模型。选择最优脉动阵列配置的问题无法解析求解,因此需要方法与工具,以便就总周期数、利用率与数据移动量快速准确地推断最优性。本文介绍Camuy,一种用于线性代数运算的权静止脉动阵列轻量模型,可快速探索不同配置,如脉动阵列维度与输入/输出位宽。Camuy协助加速器设计者或为特定网络架构寻找最优配置,或为多种网络架构间的鲁棒性能寻找配置。它通过自定义算子轻松集成至现有机器学习工具栈(如TensorFlow)。我们分析了流行DNN模型,以说明其如何估计所需周期、数据移动成本及脉动阵列利用率,并展示网络架构设计的进展如何影响基于脉动阵列的加速器推理效率。
引用
@article{arxiv.2006.14008,
title = {On the Difficulty of Designing Processor Arrays for Deep Neural Networks},
author = {Kevin Stehle and Günther Schindler and Holger Fröning},
journal= {arXiv preprint arXiv:2006.14008},
year = {2020}
}
备注
12 pages, 6 figures