SMOF:利用智能片外驱逐在 FPGA 上流式处理现代 CNN
硬件体系结构
2024-03-29 v1 计算机视觉与模式识别
机器学习
摘要
卷积神经网络(CNN)已在众多视觉任务中证明了其有效性。然而,其高处理要求需要高效的硬件加速以满足应用的性能目标。在 FPGA 领域,用户通常采用基于流的数据流架构,因为通过逐层流水线化以及通过将数据保留在片上来减少片外内存访问,可以实现显著的性能提升。然而,诸如 UNet、YOLO 和 X3D 模型等现代拓扑结构利用了长跳跃连接,需要大量的片上存储,从而限制了此类系统架构所能达到的性能。本文通过引入沿计算流水线到片外内存的权重和激活驱逐机制来解决上述限制,同时考虑可用的计算和内存资源。所提出的机制被整合到现有的工具流中,通过利用片外内存作为缓冲区来扩展设计空间。这使得在流式架构设计方法下,能够将此类现代 CNN 映射到片上内存有限的设备上。SMOF 已证明能够在一系列计算机视觉任务中提供具有竞争力的、在某些情况下是最先进的性能,与先前的工作相比实现了高达 10.65 倍的吞吐量提升。
引用
@article{arxiv.2403.18921,
title = {SMOF: Streaming Modern CNNs on FPGAs with Smart Off-Chip Eviction},
author = {Petros Toupas and Zhewen Yu and Christos-Savvas Bouganis and Dimitrios Tzovaras},
journal= {arXiv preprint arXiv:2403.18921},
year = {2024}
}
备注
12 pages, 8 figures, 5 tables