CHOSEN:面向高效视觉 Transformer 推理的硬件优化堆栈编译框架
计算机视觉与模式识别
2025-06-12 v4 人工智能
硬件体系结构
摘要
视觉 Transformer (ViT) 代表了机器学习方法在计算机视觉领域的重大突破。与传统方法不同,ViT 采用自注意力机制,这一机制广泛应用于自然语言处理中,用于分析图像块。尽管在建模视觉任务方面具有优势,但在硬件平台(尤其是 Field-Programmable Gate Arrays,FPGA)上部署 ViT 却带来了显著挑战。这些挑战主要源于 ViT 的非线性计算以及高计算和内存需求。本文引入 CHOSEN,一个软件-硬件协同设计框架,以解决这些挑战,为 ViT 在 FPGA 上的部署提供自动化框架,以实现性能最大化。我们的框架基于三个基本贡献:多核设计以最大化带宽,主要针对多 DDR 存储 bank 的优势;近似非线性函数,误差最小;高效利用 FPGA 上可用逻辑块;以及高效编译器,通过提出一种新算法进行设计空间探索,以找到最佳硬件配置,实现最佳吞吐量和延迟。与当前最先进的 ViT 加速器相比,CHOSEN 在 DeiT-S 和 DeiT-B 模型上分别实现了 1.5 倍和 1.42 倍的吞吐量提升。
关键词
引用
@article{arxiv.2407.12736,
title = {CHOSEN: Compilation to Hardware Optimization Stack for Efficient Vision Transformer Inference},
author = {Mohammad Erfan Sadeghi and Arash Fayyazi and Suhas Somashekar and Armin Abdollahi and Massoud Pedram},
journal= {arXiv preprint arXiv:2407.12736},
year = {2025}
}