面向NVFP4推理精度恢复的量化感知蒸馏
机器学习
2026-03-04 v3
摘要
本技术报告介绍了量化感知蒸馏(QAD)以及我们用于恢复NVFP4量化大语言模型(LLM)和视觉语言模型(VLM)精度的最佳实践。QAD使用KL散度损失将全精度教师模型蒸馏到量化学生模型中。虽然将蒸馏应用于量化模型并非新想法,但我们观察到QAD对当今LLM的关键优势:1. 对于通过多阶段训练后流程(包括监督微调(SFT)、强化学习(RL)和模型合并)训练的模型,它表现出显著的有效性和稳定性,而传统的量化感知训练(QAT)则面临工程复杂性和训练不稳定性;2. 它对数据质量和覆盖范围具有鲁棒性,无需完整训练数据即可实现精度恢复。我们在多个训练后模型上评估了QAD,包括AceReason Nemotron、Nemotron 3 Nano、Nemotron Nano V2、Nemotron Nano V2 VL(VLM)和Llama Nemotron Super v1,显示出持续恢复到接近BF16精度的能力。
引用
@article{arxiv.2601.20088,
title = {Quantization-Aware Distillation for NVFP4 Inference Accuracy Recovery},
author = {Meng Xin and Sweta Priyadarshi and Jingyu Xin and Bilal Kartal and Aditya Vavre and Asma Kuriparambil Thekkumpate and Zijia Chen and Ameya Sunil Mahabaleshwarkar and Ido Shahaf and Akhiad Bercovich and Kinjal Patel and Suguna Varshini Velury and Chenjie Luo and Zhiyu Cheng and Jenny Chen and Chen-Han Yu and Wei Ping and Oleg Rybakov and Nima Tajbakhsh and Oluwatobi Olabiyi and Dusan Stosic and Di Wu and Song Han and Eric Chung and Sharath Turuvekere Sreenivas and Bryan Catanzaro and Yoshi Suhara and Tijmen Blankevoort and Huizi Mao},
journal= {arXiv preprint arXiv:2601.20088},
year = {2026}
}