中文

CoQMoE:面向FPGA上混合专家视觉Transformer的量化与计算编排协同设计

硬件体系结构 2025-06-11 v1

摘要

视觉Transformer(ViT)在计算机视觉任务中表现出优越的性能,但由于高计算/内存需求,在资源受限设备上的部署面临挑战。虽然混合专家视觉Transformer(MoE-ViT)通过具有次线性计算增长的可扩展架构缓解了这一问题,但其在FPGA上的硬件实现仍受资源限制的约束。本文提出了一种新型加速器,通过两项关键创新在FPGA上高效实现量化MoE模型:(1)一种双阶段量化方案,通过尺度重参数化将保持精度的复杂量化器与硬件友好的简化量化器相结合,与全精度相比仅损失0.28%的准确率;(2)一种资源感知的加速器架构,具有延迟优化的流式注意力内核和可复用的线性算子,有效平衡了性能与资源消耗。实验结果表明,与最先进的FPGA MoE加速器相比,我们的加速器实现了近155帧每秒的帧率、5.35倍的吞吐量提升以及超过80%的能耗降低,同时在视觉基准测试中保持了低于1%的准确率损失。我们的实现可在https://github.com/DJ000011/CoQMoE获取。

关键词

引用

@article{arxiv.2506.08496,
  title  = {CoQMoE: Co-Designed Quantization and Computation Orchestration for Mixture-of-Experts Vision Transformer on FPGA},
  author = {Jiale Dong and Hao Wu and Zihao Wang and Wenqi Lou and Zhendong Zheng and Lei Gong and Chao Wang and Xuehai Zhou},
  journal= {arXiv preprint arXiv:2506.08496},
  year   = {2025}
}

备注

Accepted by Euro-Par 2025 (oral)