中文

面向嵌入式深度学习应用的参数化卷积加速器

计算机视觉与模式识别 2026-02-05 v1 硬件体系结构

摘要

通常针对 Field-可编程门阵列 (FPGA) 上实现的卷积神经网络 (CNN) 加速器主要关注最大化性能,通常以吉字节运算/秒 (GOPS) 衡量。然而,现实中的嵌入式深度学习 (DL) 应用施加了与延迟、功耗、面积和成本相关的多重约束。本文提出一种硬件-软件 (HW/SW) 协同设计方法,其中使用高级综合 (HLS) 工具描述 CNN 加速器,便于对设计进行参数化,实现更有效的跨约束优化。我们的实验结果表明,所提出的设计方法能够超越非参数化设计方法,并且可以轻松扩展到其他类型的 DL 应用。

关键词

引用

@article{arxiv.2602.04044,
  title  = {A Parameterizable Convolution Accelerator for Embedded Deep Learning Applications},
  author = {Panagiotis Mousouliotis and Georgios Keramidas},
  journal= {arXiv preprint arXiv:2602.04044},
  year   = {2026}
}

备注

6 pages, 4 figures. Published in the proceedings of the 2025 IEEE Computer Society Annual Symposium on VLSI (ISVLSI 2025), Kalamata, Greece, 6-9 July 2025