中文

Quasar-ViT:面向硬件的视觉变换器量化感知架构搜索

机器学习 2024-07-26 v1 人工智能 计算机视觉与模式识别

摘要

视觉变换器 (ViT) 相较于卷积神经网络 (CNN) 在计算机视觉任务中展现出优越的精度,但往往 computation-intensive,难以在资源受限的边缘设备上高效部署。本文提出 Quasar-ViT,一个面向硬件的ViT量化感知架构搜索框架,旨在保持精度的前提下设计适用于硬件实现的高效ViT模型。首先,Quasar-ViT 采用行级灵活混合精度量化方案、混合精度权重 entanglement 技术以及超网层级缩放技术训练超网。随后,应用集成硬件延迟与资源建模的高效硬件导向搜索算法,在不同的推理延迟目标下确定一系列最优子网。最后,本文在FPGA平台提出一系列模型自适应设计,以支持架构搜索并弥合理论计算减少与实际推理加速之间的差距。我们搜索得到的模型在AMD/Xilinx ZCU102 FPGA上分别实现了101.5、159.6和251.6帧/秒 (FPS) 的推理速度,对应ImageNet数据集的80.4%、78.6%和74.9%的Top-1精度,持续领先 prior works。

关键词

引用

@article{arxiv.2407.18175,
  title  = {Quasar-ViT: Hardware-Oriented Quantization-Aware Architecture Search for Vision Transformers},
  author = {Zhengang Li and Alec Lu and Yanyue Xie and Zhenglun Kong and Mengshu Sun and Hao Tang and Zhong Jia Xue and Peiyan Dong and Caiwen Ding and Yanzhi Wang and Xue Lin and Zhenman Fang},
  journal= {arXiv preprint arXiv:2407.18175},
  year   = {2024}
}

备注

Accepted by ICS 2024