中文

面向嵌入式 FPGA 的 Transformer 时间序列预测资源感知混合精度量化

机器学习 2026-04-22 v4

摘要

本研究针对在资源受限的嵌入式 FPGA (Xilinx Spartan-7 XC7S15) 上实现整数格式量化的 Transformer 模型部署问题,提出解决方案。我们通过引入可选资源类型用于跨模型层中间结果的存储,增强了 VHDL 模板的灵活性,从而高效利用 BRAM 资源,打破部署瓶颈。此外,我们开发了一种资源感知混合精度量化方法,使研究者无需深入了解神经网络架构搜索技术,即可探索硬件层面的量化策略。该方法提供的资源利用估计精度误差仅为约 3%。与前期工作相比,本方法成功实现了混合精度量化模型配置的部署,克服了五种 previously 无法部署的统一量化位宽配置的局限。随着本研究的推进,Transformer 在嵌入式系统中的适用性得以提升,为边缘设备上的更广泛 Transformer 应用奠定了基础。

关键词

引用

@article{arxiv.2410.03294,
  title  = {Resource-aware Mixed-precision Quantization for Enhancing Deployability of Transformers for Time-series Forecasting on Embedded FPGAs},
  author = {Tianheng Ling and Chao Qian and Gregor Schiele},
  journal= {arXiv preprint arXiv:2410.03294},
  year   = {2026}
}

备注

20 pages, 8 figures, 6 tables, accepted by the 21st EAI International Conference on Mobile and Ubiquitous Systems: Computing, Networking and Services (MobiQuitous2024)