中文

舍弃比特:在 FPGA 上以迷你浮点格式推动量化的边界

计算机视觉与模式识别 2024-07-08 v3 人工智能 硬件体系结构 机器学习 性能

摘要

训练后量化(PTQ)是一种强大的模型压缩技术,可在不产生额外训练开销的情况下降低神经网络中的数值精度。近期工作已在 PTQ 用于模型推理的背景下研究了采用 8 位浮点格式(FP8)。然而,小于 8 位的浮点格式及其在精度-硬件成本方面与整数的相对比较在 FPGA 上仍未被探索。在本工作中,我们提出迷你浮点(minifloats),即一种降低精度的浮点格式,能够在接近全精度模型精度的同时进一步减少模型的内存占用、延迟和能耗。我们实现了一个基于 FPGA 的自定义乘累加算子库,并探索了广阔的设计空间,针对权重和激活在 3 到 8 位范围内比较迷你浮点与整数表示。我们还考察了多种基于整数的量化技术对迷你浮点的适用性。我们的实验表明,迷你浮点为视觉Transformer等新兴工作负载提供了一种有前景的替代方案。

关键词

引用

@article{arxiv.2311.12359,
  title  = {Shedding the Bits: Pushing the Boundaries of Quantization with Minifloats on FPGAs},
  author = {Shivam Aggarwal and Hans Jakob Damsgaard and Alessandro Pappalardo and Giuseppe Franco and Thomas B. Preußer and Michaela Blott and Tulika Mitra},
  journal= {arXiv preprint arXiv:2311.12359},
  year   = {2024}
}

备注

Accepted in FPL (International Conference on Field-Programmable Logic and Applications) 2024 conference. Revised with updated results