中文

FPQVAR:面向视觉自回归模型的浮点量化与FPGA硬件协设计

计算机视觉与模式识别 2025-05-23 v1 人工智能

摘要

视觉自回归(VAR)建模已在图像生成领域从 next-token 预测转向 next-scale 预测,VAR 在每一步从粗到细预测一组 token,实现更好的图像质量和更快的推理速度。然而,大参数规模和计算成本阻碍了其在边缘设备上的部署。为降低内存和计算成本,我们提出了 FPQVAR,这是一个针对 VAR 的高效后训练浮点(FP)量化框架,特别强调算法与硬件协同设计。在算法层面,我们首先识别量化 VAR 的挑战,并提出针对高度不均衡输入激活的双格式量化方法。进一步提出基于组级哈达德变换(GHT)的 GHT 感知可学习变换以应对时间变化的异常通道。在硬件层面,我们设计了首个基于查找表的低位 FP 量化器和乘法器,并提出了首个基于FPGA的 VAR 加速器,特别强化了低位 FP 计算和精细的两级流水线。广泛实验表明,与当前最先进的量化方法相比,我们的 FPQVAR 在 4 位量化下将 FID 从 10.83 提升至 3.58,IS 从 175.9 提升至 241.5。FPQVAR 还显著提升了 6 位量化 VAR 的性能,使其与 FP16 模型持平。我们在 AMD-Xilinx VCK190 FPGA 上的加速器实现了 1.1 图像/秒的吞吐量,比整数级加速器高出 3.1 倍。它相较于整数级加速器和 GPU 基准分别实现了 3.6 倍和 2.8 倍的能效提升。

关键词

引用

@article{arxiv.2505.16335,
  title  = {FPQVAR: Floating Point Quantization for Visual Autoregressive Model with FPGA Hardware Co-design},
  author = {Renjie Wei and Songqiang Xu and Qingyu Guo and Meng Li},
  journal= {arXiv preprint arXiv:2505.16335},
  year   = {2025}
}