通过训练后层内多精度量化减少 DNN 内存占用
机器学习
2024-04-05 v1 人工智能
摘要
出于对隐私的担忧,在资源受限的边缘设备上部署深度神经网络 (DNN) 模型的必要性已变得日益明显。为了促进从云计算到边缘计算的过渡,本文引入了一种有效减少 DNN 内存占用的技术,在适应资源受限边缘设备限制的同时保持模型精度。我们提出的技术名为训练后层内多精度量化 (PTILMPQ),采用训练后量化方法,无需大量训练数据。通过估计网络内层和通道的重要性,所提出的方法能够在整个量化过程中实现精确的比特分配。实验结果表明,PTILMPQ 为在内存资源受限的边缘设备上部署 DNN 提供了一种有前景的解决方案。例如,对于 ResNet50,它在 9.5 MB 的内存占用下实现了 74.57% 的准确率,与以往类似方法相比减少了 25.49% 的内存占用,而准确率仅下降了 1.08%。
引用
@article{arxiv.2404.02947,
title = {DNN Memory Footprint Reduction via Post-Training Intra-Layer Multi-Precision Quantization},
author = {Behnam Ghavami and Amin Kamjoo and Lesley Shannon and Steve Wilton},
journal= {arXiv preprint arXiv:2404.02947},
year = {2024}
}
备注
The 25th International Symposium on Quality Electronic Design (ISQED'24)