BitQ:面向资源受限设备的块浮点精度优化
计算机视觉与模式识别
2024-09-26 v1
摘要
深度神经网络(DNN)强大地用于认知任务,如图像分类、目标检测和场景分割。然而其显著的高计算复杂度和内存消耗是其缺点,使得它们在嵌入式平台上因硬件资源有限而难以实时运行。块浮点(BFP)量化是代表性压缩方法之一,能够有效捕获 DNN 模型广泛的数据分布,从而减轻内存和计算负担。然而,现有 BFP 量化工作会经验性地选择块大小和精度以保持准确性。本文开发了一种 BFP 基于位宽感知的解析建模框架(称为 "BitQ"),用于在嵌入式平台上实现 DNN 推理的最佳 BFP 实现。我们对准确性和性能损失之间的权衡进行建模并求解优化问题,以识别最佳 BFP 块大小和位宽分布。实验结果表明,与相等位宽设置相比,经优化的位宽分配的 BFP DNN 提供了高效计算,同时在著名基准测试上保持了准确性。源代码和数据已发布于 https://github.com/Cheliosoops/BitQ。
引用
@article{arxiv.2409.17093,
title = {BitQ: Tailoring Block Floating Point Precision for Improved DNN Efficiency on Resource-Constrained Devices},
author = {Yongqi Xu and Yujian Lee and Gao Yi and Bosheng Liu and Yucong Chen and Peng Liu and Jigang Wu and Xiaoming Chen and Yinhe Han},
journal= {arXiv preprint arXiv:2409.17093},
year = {2024}
}