VAQF:面向低比特视觉 Transformer 的全自动软硬件协同设计框架
机器学习
2022-02-21 v2 计算机视觉与模式识别
摘要
具有注意力机制的 transformer 架构已在自然语言处理(NLP)中取得成功,而视觉 Transformer(ViT)近来将应用领域扩展至各类视觉任务。在取得高性能的同时,ViT 面临模型规模大、计算复杂度高的问题,阻碍其在边缘设备上的部署。为同时在硬件上实现高吞吐并保持模型精度,我们提出 VAQF,一个在 FPGA 平台上为具有二值权重和低精度激活的量化 ViT 构建推理加速器的框架。给定模型结构与期望帧率,VAQF 将自动输出激活所需的量化精度以及满足硬件要求的加速器优化参数设置。实现基于 Xilinx ZCU102 FPGA 板上的 Vivado 高层次综合(HLS)开发,使用 DeiT-base 模型的评估结果表明:8 位激活量化满足 24 帧每秒(FPS)的帧率要求,6 位激活量化达到 30 FPS 的目标。据我们所知,这是首次在 FPGA 上借助全自动框架将量化引入 ViT 加速,该框架在给定目标帧率下指导软件侧量化策略与硬件侧加速器实现。与量化训练相比,其编译时间开销极小,且生成的加速器展现出为最先进 ViT 模型在 FPGA 上实现实时执行的能力。
引用
@article{arxiv.2201.06618,
title = {VAQF: Fully Automatic Software-Hardware Co-Design Framework for Low-Bit Vision Transformer},
author = {Mengshu Sun and Haoyu Ma and Guoliang Kang and Yifan Jiang and Tianlong Chen and Xiaolong Ma and Zhangyang Wang and Yanzhi Wang},
journal= {arXiv preprint arXiv:2201.06618},
year = {2022}
}