中文

FP=xINT:通过低位系列基函数表示神经网络

机器学习 2025-12-24 v2 人工智能

摘要

后训练量化(PTQ)将预训练的全精度(FP)模型转换为无需训练的量化版本。虽然现有方法在减小模型大小和计算成本方面取得了一定进展,但在极端低精度设置下会显著降低性能和量化效率 due to 量化噪声。我们引入了深度模型级数展开框架,以解决此问题,使无需校准集或微调即可快速准确地近似未量化的模型。这首次将级数展开用于神经网络量化。具体而言,我们的方法将FP模型扩展为多个低位基模型。为确保量化准确性,我们在不同粒度(张量、层、模型)上开发了低位基模型的展开,并理论上确认它们收敛于稠密模型,从而恢复FP模型的准确性。此外,我们设计了在低位展开中进行等构模型之间运算的AbelianAdd/Mul操作,形成阿贝尔群,以确保运算的并行性和可交换性。实验表明,我们的算法在低位设置下实现了最佳性能;例如,ResNet-50的4位量化超越了原始准确率,达到了77.03%。该代码将公开发布。

关键词

引用

@article{arxiv.2412.06865,
  title  = {FP=xINT:Representing Neural Networks via Low-Bit Series Basis Functions},
  author = {Boyang Zhang and Daning Cheng and Yunquan Zhang and Jiake Tian and Jing Li and Fangming Liu},
  journal= {arXiv preprint arXiv:2412.06865},
  year   = {2025}
}

备注

AAAI2026