边缘AI FPGA加速器的数据流与铺排策略:综合文献综述
硬件体系结构
2025-06-03 v3
摘要
边缘AI应用对FPGA上的高吞吐量、低延迟推理提出了严格的资源和功耗约束。本综述提供了针对FPGA基 neural network 加速器的两个关键架构决策的全面回顾:(i)数据流(数据在chip上移动和重用的顺序与方式),以及(ii)铺排/阻塞策略(大型张量如何被划分为适合on-chip的块)。我们首先提出了规范数据流样式的广泛分类:Weight-Stationary、Output-Stationary、Row-Stationary和No-Local-Reuse,包括形式化定义、伪代码/图示以及真实FPGA实例。随后我们讨论了分析框架(如MAESTRO、Timeloop),并与简洁的特征表进行比较,说明这些框架如何建模重用、性能和硬件成本,并包括一个3x3卷积层的案例研究,以展示典型工具的输出。接下来我们详细阐述了多级铺排和循环展开/流水线策略,以澄清每种内存层级(寄存器、LUTRAM、BRAM、HBM)如何被利用。我们的四个案例研究-FINN、FINN-R、FlightLLM和SSR-突显了不同的数据流(从二进制流式到混合稀疏转换)和铺排模式。我们包括统一的比较矩阵,覆盖平台、精度、吞吐量、资源利用率和能源效率,并为每个设计附上小型框图。我们总结了在HLS、DSL和手编码RTL之间的设计自动化权衡,提供了"经验教训"总结框,并绘制了面向下一代边缘AI FPGA加速器的未来研究方向图,包括局部分 reconfigure、混合数据流和面向特定领域的编译器流。
引用
@article{arxiv.2505.08992,
title = {Dataflow & Tiling Strategies in Edge-AI FPGA Accelerators: A Comprehensive Literature Review},
author = {Richie Li},
journal= {arXiv preprint arXiv:2505.08992},
year = {2025}
}
备注
4 pages, 3 tables, 4 diagrams. Submitted as part of UCI Edge AI research initiative