MatGPTQ:准确且高效的后训练Matryoshka量化
机器学习
2026-02-04 v1
摘要
Matryoshka量化(MatQuant)是一种近期出现的量化方法,表明单个整数量化模型可通过在推理时对最有效位(MSB)进行切片,跨越多个精度等级。这使单一检查点能够覆盖广泛的内存和延迟预算,但使量化更加困难。特别是,初始MatQuant依赖昂贵的量化感知训练(QAT)变体,而非快速的单次后训练量化(PTQ),且缺乏开源和内核支持。我们针对这些限制提出了后训练Matryoshka量化(MatGPTQ),这是一种新的PTQ管道,通过小型校准数据集单次生成为多个目标精度 jointly 优化的单个父模型。MatGPTQ将Matryoshka量化建模为多精度目标,结合位切片和跨位误差补偿,产生一种在单次传递中产生多位宽、可切片模型的算法。我们还集成了一种预算感知搜索,用于异构每层位宽,并提供高效内核以实现切片和混合精度执行。在标准LLM和基准测试中,MatGPTQ在保持高位准确性的同时,在低位宽设置下显著提升性能。总体而言,我们为Matryoshka式后训练量化树立了新的最先进技术,使单检查点、多精度部署开源且实用。代码地址:https://github.com/IST-DASLab/MatGPTQ。
关键词
引用
@article{arxiv.2602.03537,
title = {MatGPTQ: Accurate and Efficient Post-Training Matryoshka Quantization},
author = {Maximilian Kleinegger and Elvir Crnčević and Dan Alistarh},
journal= {arXiv preprint arXiv:2602.03537},
year = {2026}
}
备注
Preprint