中文

面向FPGA的通用混合专家视觉Transformer加速器UbiMoE

硬件体系结构 2025-02-18 v3

摘要

与传统视觉Transformer (ViT) 相比,混合专家视觉Transformer (MoE-ViT) 能够在不按比例增加计算复杂度的前提下扩大模型规模,成为新的研究焦点。鉴于其卓越的性能和可重构性,FPGA-based MoE-ViT加速器正在为其带来显著优势。然而,现有加速器往往未能充分探索设计空间,导致资源利用与性能之间存在次优权衡。为克服此问题,我们提出UbiMoE,一种针对MoE-ViT的新型面向FPGA的端到端加速器。利用MoE-ViT独特的计算与内存访问模式,我们开发了面向延迟优化的流式注意力内核和面向资源效率的可重用线性内核,有效平衡了性能与资源消耗。为进一步提升设计效率,我们提出两种阶段的启发式搜索算法,以针对各种FPGA资源约束进行硬件参数的最优调优。相较于当前最先进 (SOTA) 的FPGA设计,UbiMoE在Xilinx ZCU102和Alveo U280平台上分别实现了1.34倍和3.35倍的吞吐量提升,同时提升了能源效率1.75倍和1.54倍。我们的实现已公开于https://github.com/DJ000011/UbiMoE。

关键词

引用

@article{arxiv.2502.05602,
  title  = {UbiMoE: A Ubiquitous Mixture-of-Experts Vision Transformer Accelerator With Hybrid Computation Pattern on FPGA},
  author = {Jiale Dong and Wenqi Lou and Zhendong Zheng and Yunji Qin and Lei Gong and Chao Wang and Xuehai Zhou},
  journal= {arXiv preprint arXiv:2502.05602},
  year   = {2025}
}

备注

Accepted by ISCAS 2025 (oral)