通过分块实现内存受限 FPGA 上的长 FFT 卷积
机器学习
2026-01-13 v1 硬件体系结构
摘要
长上下文推理的需求促使 Transformer 与自注意力机制之外的另类神经网络架构崛起,其中一种流行模型是 Hyena,后者采用由 FFT 实现的因果 1D 卷积。长卷积可实现高效的全局上下文混合,但中间结果需求超出 FPGA(FPGA)2-3 MB 的块存储器容量。我们提出一种分块 FFT 卷积方法,使 Alveo U200 FPGA 上实现 450K 长度序列与 450K 长度滤波器的卷积,仅通过分块与重叠相加重构即可适配 2.8 MB BRAM。我们发现吞吐量随块大小比例增长,而对最长序列的性能下降最小仅为 7%,这表明精细的内存管理能够在不牺牲性能的前提下,将长上下文原语部署到边缘 FPGA 上。
引用
@article{arxiv.2601.06065,
title = {Enabling Long FFT Convolutions on Memory-Constrained FPGAs via Chunking},
author = {Peter Wang and Neelesh Gupta and Viktor Prasanna},
journal= {arXiv preprint arXiv:2601.06065},
year = {2026}
}
备注
2 pages, submitted to 2025 HiPC Conference