中文

通过分块实现内存受限 FPGA 上的长 FFT 卷积

机器学习 2026-01-13 v1 硬件体系结构

摘要

长上下文推理的需求促使 Transformer 与自注意力机制之外的另类神经网络架构崛起,其中一种流行模型是 Hyena,后者采用由 FFT 实现的因果 1D 卷积。长卷积可实现高效的全局上下文混合,但中间结果需求超出 FPGA(FPGA)2-3 MB 的块存储器容量。我们提出一种分块 FFT 卷积方法,使 Alveo U200 FPGA 上实现 450K 长度序列与 450K 长度滤波器的卷积,仅通过分块与重叠相加重构即可适配 2.8 MB BRAM。我们发现吞吐量随块大小比例增长,而对最长序列的性能下降最小仅为 7%,这表明精细的内存管理能够在不牺牲性能的前提下,将长上下文原语部署到边缘 FPGA 上。

关键词

引用

@article{arxiv.2601.06065,
  title  = {Enabling Long FFT Convolutions on Memory-Constrained FPGAs via Chunking},
  author = {Peter Wang and Neelesh Gupta and Viktor Prasanna},
  journal= {arXiv preprint arXiv:2601.06065},
  year   = {2026}
}

备注

2 pages, submitted to 2025 HiPC Conference