FraQAT:基于分数位数的量化感知训练
计算机视觉与模式识别
2025-10-17 v1
摘要
最先进(SOTA)生成模型在图像合成或文本生成方面展现了惊人的能力,往往需要大规模模型。然而,这些大型模型无法在智能手机上部署,因为现场内存和计算资源有限。量化方法降低模型参数的精度,从而实现高效计算,例如在 \INT{8}。虽然激进的量化解决了效率和内存约束问题,但在保持模型质量方面仍面临挑战。为保留前述激进量化的质量,我们提出一种新的分数位数量化(\short)方法。其核心思想简单而有效:我们逐步将模型参数的精度从 32 位降低到 4 位,并在优化过程中利用分数位数以维持高质量的生成。我们展示了 \short{} 在包括 SD3.5-Medium、Sana、\pixart 和 FLUX.1-schnell 在内的多种扩散模型上均取得改进的质量,同时实现了比标准 QAT 低 的 FiD。最后,我们在三星 S25U 上部署运行 Sana,设备使用的是 Qualcomm SM8750-AB Snapdragon 8 Elite Hexagon Tensor Processor(HTP)。
引用
@article{arxiv.2510.14823,
title = {FraQAT: Quantization Aware Training with Fractional bits},
author = {Luca Morreale and Alberto Gil C. P. Ramos and Malcolm Chadwick and Mehid Noroozi and Ruchika Chavhan and Abhinav Mehrotra and Sourav Bhattacharya},
journal= {arXiv preprint arXiv:2510.14823},
year = {2025}
}