中文

嵌入式推理加速器硬件架构及深度可分离与大核卷积算法分析

计算机视觉与模式识别 2021-04-30 v1 硬件体系结构 图像与视频处理

摘要

为高效处理现代卷积神经网络(CNNs),提出一种CNN推理加速器硬件架构以处理深度可分离卷积与常规卷积,二者均为嵌入式计算机视觉算法的基本构件。与相关工作不同,所提架构可高灵活地支持不同尺寸滤波器核,因其不需要核内并行性的额外开销,且能比相关工作的架构更快地生成卷积结果。实验结果表明所提硬件架构支持深度可分离卷积与膨胀卷积的重要性。除大核深度可分离卷积外,本文还分析了称为DDC层的新结构,其包含深度可分离卷积与膨胀卷积的组合。对于人脸检测,应用DDC层到网络时计算成本降低30%,模型大小减小20%。对于图像分类,仅需将深度可分离卷积中的 3×33 \times 3 滤波器替换为 5×55 \times 5 滤波器,精度即提升1%。

关键词

引用

@article{arxiv.2104.14125,
  title  = {Hardware Architecture of Embedded Inference Accelerator and Analysis of Algorithms for Depthwise and Large-Kernel Convolutions},
  author = {Tse-Wei Chen and Wei Tao and Deyu Wang and Dongchao Wen and Kinya Osa and Masami Kato},
  journal= {arXiv preprint arXiv:2104.14125},
  year   = {2021}
}

备注

Camera-ready version for ECCV 2020 workshop (Embedded Vision Workshop)