中文

FINN-GL:面向 FPGA 加速 LSTM 的广义混合精度扩展

机器学习 2025-06-27 v1 人工智能 硬件体系结构 信号处理

摘要

循环神经网络(RNN),尤其是 LSTM,在情感分析和短期股票预测等时间序列任务中非常有效。然而,它们的计算复杂性给在资源受限环境中进行实时部署带来了挑战。虽然 FPGA 为节能 AI 加速提供了一个有前景的平台,但现有工具主要针对前馈网络,而 LSTM 加速通常需要完全定制的实现。在本文中,我们通过利用开源且可扩展的 FINN 框架来实现 LSTM 在 FPGA 上的广义部署,从而解决了这一差距。具体来说,我们利用开放神经网络交换(ONNX)规范中的 Scan 算子来对 LSTM 计算的循环特性进行建模,从而支持其中的混合量化以及基于 LSTM 的模型的功能验证。此外,我们在 FINN 编译器中引入了自定义转换,以将量化的 ONNX 计算图映射到 FINN 编译器和 Vitis HLS 的 HLS 内核库中的硬件块。我们通过使用广泛使用的数据集训练用于中间价股票预测任务的量化 ConvLSTM 模型,并使用我们的流程生成该模型的相应硬件 IP(目标器件为 XCZU7EV),验证了所提出的工具流程。我们表明,通过我们的流程生成的量化 ConvLSTM 加速器在性能(延迟)和资源消耗之间取得了平衡,同时在降低精度的情况下匹配(或优于)最先进模型的推理精度。我们相信,所提出流程的可推广特性将为 FPGA 上的资源高效 RNN 加速器设计铺平道路。

关键词

引用

@article{arxiv.2506.20810,
  title  = {FINN-GL: Generalized Mixed-Precision Extensions for FPGA-Accelerated LSTMs},
  author = {Shashwat Khandelwal and Jakoba Petri-Koenig and Thomas B. Preußer and Michaela Blott and Shreejith Shanker},
  journal= {arXiv preprint arXiv:2506.20810},
  year   = {2025}
}

备注

9 pages, 6 figures, 5 tables, Accepted for publication in IEEE FPL-2025 (https://2025.fpl.org/)