USEFUSE:深度神经网络融合层架构中用于增强性能的均匀步长
机器学习
2025-05-14 v2 硬件体系结构
性能
摘要
卷积神经网络(CNN)在各种应用中至关重要,但将其部署在资源受限的边缘设备上带来了挑战。本研究提出了用于卷积的积之和(SOP)单元,该单元利用低延迟的从左到右位串行算术来最小化响应时间并增强整体性能。该研究提出了一种融合多个卷积层的方法,以减少片外存储器通信并提高整体性能。一种有效的机制检测并跳过 ReLU 层之后的低效卷积,在不影响精度的前提下最小化功耗。此外,高效的平移移动保证了对融合金字塔的均匀访问。分析表明,有效的步长策略提高了运算强度。两种设计满足了不同的需求:一种侧重于任务关键型应用的最小响应时间,另一种则侧重于具有可比延迟的资源受限设备。该方法显著减少了冗余计算,提高了 CNN 在边缘设备上部署的效率。
引用
@article{arxiv.2412.13724,
title = {USEFUSE: Uniform Stride for Enhanced Performance in Fused Layer Architecture of Deep Neural Networks},
author = {Muhammad Sohail Ibrahim and Muhammad Usman and Jeong-A Lee},
journal= {arXiv preprint arXiv:2412.13724},
year = {2025}
}
备注
Accepted for publication in the Journal of Systems Architecture on 11 May, 2025