中文

ACCO:面向实时边缘加速器的自动因果CNN调度优化器

信号处理 2024-06-12 v1

摘要

时空卷积神经网络(ST-CNN)允许将CNN能力从图像处理扩展到连续时序模式识别。然而,当前最先进(SotA)的ST-CNN会从众所指知的CNN骨干网络中膨胀特征图和权重,以表示额外的时间维度。但边缘计算应用将面临巨大的计算和内存开销。幸运的是,ST-CNN的重叠性质使各种优化成为可能,包括稀疏因果卷积结构和深度优先(DF)层融合,以在时间步之间和CNN滑动窗口之间复用计算。然而,尚未提出面向硬件的方案,能够从调度和硬件两个角度联合探索最优策略。为此,本文提出ACCO——一个自动化优化器,用于在边缘硬件加速器上探索高效的因果CNN转换和DF调度。通过对加速器架构中的计算和数据移动进行成本建模,ACCO自动选择针对给定硬件-算法目标的最佳调度策略。相较于固定的稀疏因果结构,采用ACCO的ST-CNN在能耗-延迟乘积上实现约8.4倍的提升。同时,ACCO相较于SotA DF探索工具链实现约20%的层融合优化提升。当在时空维度上联合优化ST-CNN时,ACCO的调度结果平均比空间DF方案快19倍、能效提升37倍。

关键词

引用

@article{arxiv.2406.07161,
  title  = {ACCO: Automated Causal CNN Scheduling Optimizer for Real-Time Edge Accelerators},
  author = {Jun Yin and Linyan Mei and Andre Guntoro and Marian Verhelst},
  journal= {arXiv preprint arXiv:2406.07161},
  year   = {2024}
}