中文

面向高效 N:M 稀疏与量化模型推理的 FPGA 软硬件协同设计

机器学习 2026-01-21 v2 硬件体系结构

摘要

大型语言模型(LLMs)在广泛的语言处理任务中展现出卓越性能。然而,这一成功以巨大的计算和内存需求为代价,严重阻碍了其在资源受限环境中的部署。为应对这一挑战,本文引入一个利用权重剪枝和低比特量化的自动化框架,并提出一种软硬件协同设计方法,在 FPGA 平台上生成加速器。具体而言,我们实现了一条统一流水线,应用 N:M 结构化剪枝和 4 比特整数量化以减少内存占用,随后通过优化的反量化和矩阵乘法,在包括 CPU、配备密集与 2:4 稀疏张量核心的 NVIDIA GPU 以及基于脉动阵列的定制 FPGA 加速器在内的多种硬件平台上增强 LLM 推理。在 4096×40964096 \times 4096 矩阵上结合 2:4 稀疏与量化,我们的方法实现了权重存储最多 4×4\times 的缩减和矩阵乘法 1.71×1.71\times 的加速,与密集 GPU 基线相比,端到端延迟降低了 1.29×1.29\times。对 LLaMA-7B 模型的扩展分析进一步表明,结构化稀疏性将每令牌吞吐量提升了 1.36×1.36\times。这些结果证明了细粒度 N:M 稀疏性与量化在实现高效且可部署的 LLM 推理方面的协同作用,而所提出的 FPGA 加速器为支持超出固定 2:4 硬件约束的更广泛稀疏模式类别提供了一条灵活的架构路径。

关键词

引用

@article{arxiv.2512.24713,
  title  = {FPGA Co-Design for Efficient N:M Sparse and Quantized Model Inference},
  author = {Fen-Yu Hsieh and Yun-Chang Teng and Ding-Yong Hong and Jan-Jan Wu},
  journal= {arXiv preprint arXiv:2512.24713},
  year   = {2026}
}

备注

Withdrawn due to substantial inconsistencies between the machine-learning pipeline and the independently developed FPGA-based hardware accelerator. The manuscript does not reflect a coherent, jointly developed system and a clearly integrated methodology