PQuantML:面向端到端硬件感知模型压缩的工具
机器学习
2026-03-30 v1 高能物理 - 实验
摘要
PQuantML是一个新的开源、硬件感知的神经网络模型压缩库,专为端到端工作流设计。由于需要将高性能模型部署到具有严格延迟约束的环境中,PQuantML通过提供统一接口来应用剪枝和量化(可联合或单独应用),简化了压缩模型的训练。该库实现了多种不同粒度的剪枝方法,以及支持高粒度量化(High-Granularity Quantization)的定点量化。我们在代表性任务如喷注子结构分类(即喷注标记,jet tagging)上评估了PQuantML,这是一个与LHC实时数据处理相关的边缘问题。通过使用各种剪枝方法结合定点量化,PQuantML在保持准确性的同时实现了显著的参数和位宽减少。所得压缩效果进一步与现有工具(如QKeras和HGQ)进行了比较。
引用
@article{arxiv.2603.26595,
title = {PQuantML: A Tool for End-to-End Hardware-aware Model Compression},
author = {Roope Niemi and Anastasiia Petrovych and Arghya Ranjan Das and Enrico Lupi and Chang Sun and Dimitrios Danopoulos and Marlon Joshua Helbing and Mia Liu and Sebastian Dittmeier and Michael Kagan and Vladimir Loncar and Maurizio Pierini},
journal= {arXiv preprint arXiv:2603.26595},
year = {2026}
}