中文

NestQuant:面向设备端 DNN 的训练后整数嵌套量化

机器学习 2025-06-24 v1 人工智能 分布式、并行与集群计算

摘要

在无处不在的物联网设备上部署具有资源自适应能力的量化深度神经网络(DNN)模型以提供高质量 AI 服务,可以利用压缩的优势并满足多场景的资源需求。然而,现有的动态/混合精度量化需要重新训练或特殊硬件,而训练后量化(PTQ)在资源自适应方面存在两个限制: 现有的 SOTA PTQ 方法仅提供一种固定位宽的模型,这使得适应 IoT 设备的动态资源具有挑战性; 部署多个具有不同位宽的 PTQ 模型会消耗大量存储资源并产生切换开销。为此,本文介绍了一种资源友好的训练后整数嵌套量化,即 NestQuant,用于 IoT 设备上的设备端量化模型切换。所提出的 NestQuant 包含整数权重分解,该分解按位将量化权重拆分为整数数据类型的高位和低位权重。它还包含一种分解权重嵌套机制,通过自适应舍入优化高位权重,并将其嵌套到原始量化权重中。在部署时,我们可以仅发送和存储一个 NestQuant 模型,并通过换入/换出低位权重在全位/部分位模型之间进行切换,以适应资源变化并减少消耗。在 ImageNet-1K 预训练 DNN 上的实验结果表明,NestQuant 模型可以在 Top-1 准确率上实现高性能,并在数据传输、存储消耗和切换开销方面实现减少。特别是,带有 INT8 嵌套 INT6 的 ResNet-101 在全位和部分位模型中分别达到了 78.1% 和 77.9% 的准确率,并且与不同位宽的 PTQ 模型相比,切换开销减少了约 78.1%。

关键词

引用

@article{arxiv.2506.17870,
  title  = {NestQuant: Post-Training Integer-Nesting Quantization for On-Device DNN},
  author = {Jianhang Xie and Chuntao Ding and Xiaqing Li and Shenyuan Ren and Yidong Li and Zhichao Lu},
  journal= {arXiv preprint arXiv:2506.17870},
  year   = {2025}
}

备注

IEEE Transactions on Mobile Computing, accepted manuscript, DOI: 10.1109/TMC.2025.3582583; Code: https://github.com/jianhayes/NESTQUANT