QuEPT:一种用于多位切换的一键校准量化弹性精度 Transformer
计算机视觉与模式识别
2026-02-16 v1 人工智能
摘要
弹性精度量化使通过单次优化实现多位部署,适用于多种量化场景。然而,Transformer 架构的高存储需求和优化成本,使得该领域的弹性量化研究仍有限,尤其是针对大型语言模型。本文提出 QuEPT,一种高效的后训练方案,通过对小数据切片进行一次校准,重构块状多位误差。它能够通过级联不同低秩适配器动态适应各种预定义位宽,并支持在统一量化与混合精度量化之间实时切换,无需重复优化。为提升准确性和鲁棒性,我们引入了多位 Token 合并(MB-ToMe),在不同位宽之间动态融合 token 特征,提高位宽切换时的鲁棒性。此外,我们提出了多位级联低秩适配器(MB-CLoRA),进一步加强位宽组之间的相关性,提升 QuEPT 的总体性能。大量实验表明,QuEPT 在性能上与现有最先进的后训练量化方法相当或更优。我们的代码已公开于 https://github.com/xuke225/QuEPT
关键词
引用
@article{arxiv.2602.12609,
title = {QuEPT: Quantized Elastic Precision Transformers with One-Shot Calibration for Multi-Bit Switching},
author = {Ke Xu and Yixin Wang and Zhongcheng Li and Hao Cui and Jinshui Hu and Xingyi Zhang},
journal= {arXiv preprint arXiv:2602.12609},
year = {2026}
}
备注
Accepted by AAAI 2026