中文

一种面向CNN加速、带向量指令集的应用专用VLIW处理器

硬件体系结构 2019-07-18 v1 机器学习

摘要

近年来,神经网络在物体识别等领域已超越经典算法,例如在著名的ImageNet挑战赛中。因此,人们大力投入开发快速高效的加速器,尤其是针对卷积神经网络(CNNs)的加速器。本工作提出ConvAix,一种完全可用C语言编程的处理器,与许多现有架构不同,它不依赖于硬连线的乘加(MAC)单元阵列,而是将计算映射到独立的向量通道上,并利用精心设计的向量指令集。该处理器面向延迟敏感型应用,每个周期最多可执行192次MAC操作。ConvAix在28nm CMOS工艺下以400 MHz目标时钟频率运行,从而在其目标领域内以适当的灵活性提供最先进的性能。来自知名CNNs(AlexNet、VGG-16)的若干二维卷积层的仿真结果表明,使用16位定点算术的向量指令时,平均ALU利用率为72.5%。与其他灵活性较差的知名设计相比,ConvAix提供高达497 GOP/s/W的具竞争力的能效,甚至在面积效率和的处理速度方面超越它们。

关键词

引用

@article{arxiv.1904.05106,
  title  = {An Application-Specific VLIW Processor with Vector Instruction Set for CNN Acceleration},
  author = {Andreas Bytyn and Rainer Leupers and Gerd Ascheid},
  journal= {arXiv preprint arXiv:1904.05106},
  year   = {2019}
}

备注

Accepted for publication in the proceedings of the 2019 IEEE International Symposium on Circuits and Systems (ISCAS)