中文

ONNX模型的选择性量化调谐器

机器学习 2026-02-03 v2 人工智能 系统与控制 系统与控制

摘要

量化通过降低深度神经网络的精度来降低模型大小和计算需求,但往往以牺牲准确率为代价。完全量化的模型可能出现显著的准确率下降,而资源受限的硬件加速器可能不支持所有量化运算。常见的解决方法是选择性量化,即仅对部分层进行量化,而其他层保持全精度。然而,确定准确率与效率之间的最佳平衡点是一个具有挑战性的任务。为此,我们提出SeQTO(Selective Quantization Tuner for ONNX models),该框架支持ONNX模型的选择性量化、部署和执行,适用于多种CPU和GPU设备,并结合剖析和多目标优化。SeQTO生成选择性量化模型,在硬件加速器上进行部署,评估诸如准确率和模型大小等性能指标,应用帕累托前沿(Pareto Front)进行目标最小化,以识别最佳候选模型,并提供结果可视化。我们在四个ONNX模型上进行了评估,分别在两种量化设置下进行CPU和GPU设备的测试。我们的结果表明,SeQTO能够有效识别高质量的选择性量化模型,在保持最高可达98.18%模型大小减小的同时,实现最高可达54.14%的准确率损失降低。

关键词

引用

@article{arxiv.2507.12196,
  title  = {A Selective Quantization Tuner for ONNX Models},
  author = {Nikolaos Louloudakis and Ajitha Rajan},
  journal= {arXiv preprint arXiv:2507.12196},
  year   = {2026}
}

备注

5 pages, 3 figures, 2 tables