使用神经ODE的轻量级Transformer模型的低成本FPGA实现
机器学习
2024-10-18 v3 硬件体系结构
摘要
Transformer已被应用于图像识别任务,并显示出优于CNN和RNN的性能,但训练成本高且计算复杂度大。为了解决这些问题,一种混合方法成为近期研究趋势,即用MHSA(多头自注意力)替换部分ResNet。本文提出一种轻量级混合模型,使用神经ODE(常微分方程)作为骨干网络代替ResNet,从而可以在重用相同参数的同时增加构建块的迭代次数,缓解每次迭代参数大小的增加。所提模型部署在中等规模的FPGA设备上用于边缘计算。模型进一步通过QAT(量化感知训练)方案进行量化,以减少FPGA资源利用同时抑制精度损失。量化模型在包含96×96像素图像的STL10数据集上达到79.68%的top-1准确率。特征提取网络的权重存储在片上以最小化内存传输开销,实现更快的推理。通过消除内存传输开销,推理可以无缝执行,从而加速推理。所提出的FPGA实现将骨干和MHSA部分加速34.01倍,在考虑软件预处理和后处理后实现9.85倍的整体加速。与ARM Cortex-A53 CPU相比,FPGA加速带来7.10倍的能效提升。本文在Xilinx ZCU104板上演示了所提出的轻量级Transformer模型用于96×96像素图像的识别,并且可以通过修改预处理层应用于不同图像尺寸。
引用
@article{arxiv.2401.02721,
title = {A Cost-Efficient FPGA Implementation of Tiny Transformer Model using Neural ODE},
author = {Ikumi Okubo and Keisuke Sugiura and Hiroki Matsutani},
journal= {arXiv preprint arXiv:2401.02721},
year = {2024}
}