PROM:为高效CNN优先减少乘法而非降低位宽
计算机视觉与模式识别
2025-08-07 v2 机器学习
摘要
卷积神经网络(CNN)对于资源受限设备上的计算机视觉任务至关重要。量化有效地压缩了这些模型,减少了存储大小和能源成本。然而,在现代深度可分离架构中,计算成本在其组件间分布不均,其中逐点运算最为昂贵。通过对这种不平衡的成本分布应用通用量化方案,现有的量化方法未能充分利用潜在的效率增益。为此,我们引入了PROM,这是一种通过选择性地使用两种不同位宽来量化现代深度可分离卷积网络的直接方法。具体来说,逐点卷积被量化为三元权重,而其余模块使用8位权重,这通过一个简单的量化感知训练过程实现。此外,通过将激活量化为8位,我们的方法将具有三元权重的逐点卷积转换为int8加法,这得到了硬件平台的广泛支持,并有效地消除了对昂贵乘法的需求。将PROM应用于MobileNetV2,与float16基线相比,模型的能耗成本降低了超过一个数量级(23.9倍),存储大小减少了2.7倍,同时在ImageNet上保持了相似的分类性能。我们的方法推动了ImageNet上量化卷积模型在能耗与Top-1准确率方面的帕累托前沿。PROM解决了将深度可分离卷积网络量化为三元和8位权重的挑战,提供了一种降低能耗成本和存储大小的简单方法。
引用
@article{arxiv.2505.03254,
title = {PROM: Prioritize Reduction of Multiplications Over Lower Bit-Widths for Efficient CNNs},
author = {Lukas Meiner and Jens Mehnert and Alexandru Paul Condurache},
journal= {arXiv preprint arXiv:2505.03254},
year = {2025}
}
备注
Accepted at the European Conference on Artificial Intelligence (ECAI) 2025, full version of the paper including supplementary material