基于 FPGA 的 AI 加速器架构设计与性能分析:综合综述
硬件体系结构
2026-03-11 v1 人工智能
摘要
深度学习(DL)已成为快速发展的先进技术,使其能够以高精度处理图像识别、自然语言处理和自主决策等复杂任务。然而,随着技术演进和追求满足日常应用日益增长的需求,DL 模型的复杂度持续增加。这些模型需要处理海量数据,要求巨大的计算能力和内存带宽,从而催生了对能够提供高性能和能效硬件加速器的迫切需求。加速器类型包括基于 ASIC 的解决方案、GPU 加速器和 FPGA 实现。ASIC 和 GPU 加速器的局限性导致 FPGA 成为 DL 工作负载的突出解决方案,后者提供了灵活可重构的平台,允许实现模型特定的定制化,同时保持高效率。本文探讨了 DL 的各种硬件层优化技术,包括循环流水线、并行化、量化以及各种内存层次增强。此外,本文提供了最新 FPGA 基于神经网络加速器的概览。通过对这些加速器的研究与分析,已识别出若干挑战,为未来在 FPGA 基于硬件加速器设计中进行的优化与创新铺平了道路。
引用
@article{arxiv.2603.08740,
title = {Architectural Design and Performance Analysis of FPGA based AI Accelerators: A Comprehensive Review},
author = {Soumita Chatterjee and Sudip Ghosh and Tamal Ghosh and Hafizur Rahaman},
journal= {arXiv preprint arXiv:2603.08740},
year = {2026}
}