MF-QAT:面向弹性推理的多格式量化感知训练
机器学习
2026-04-02 v1 计算与语言
摘要
量化感知训练(QAT)通常针对单一目标数值格式进行,而实际部署往往需要根据硬件支持或运行时约束在推理时选择数值精度。我们研究多格式QAT,即在训练单个模型时使其对多种量化格式鲁棒。我们发现,多格式QAT在每个目标精度上都可匹配单格式QAT,产生一个在不同格式下性能均佳的模型,甚至包括训练时未出现的格式。为实现实际部署,我们提出了针对MXINT和MXFP的切片-缩放(Slice-and-Scale)转换程序,将高精度表示转换为低精度格式而无需重新训练。建立在此基础上,我们引入一个管道:(i)进行多格式QAT训练,(ii)存储单个锚定格式检查点(MXINT8/MXFP8),(iii)在推理时可即时转换为低精度MXINT或MXFP格式,几乎或无额外精度损失。通过这些组件,为弹性精度缩放提供了实用路径,使我们能够在 diverse 部署目标上选择推理时的格式。
引用
@article{arxiv.2604.00529,
title = {MF-QAT: Multi-Format Quantization-Aware Training for Elastic Inference},
author = {Zifei Xu and Sayeh Sharify and Hesham Mostafa},
journal= {arXiv preprint arXiv:2604.00529},
year = {2026}
}