中文

基于未来激活感知提升后训练量化

机器学习 2026-02-04 v1 计算与语言 计算机视觉与模式识别

摘要

后训练量化(PTQ)是一种广泛用于压缩大语言模型(LLM)而无需微调的方法。它通常根据当前层激活值设置量化超参数(如缩放因子)。虽然该方法高效,但会产生量化偏差和误差累积,导致在校准数据偏斜时出现次优且不稳定的量化效果。为克服这些问题,我们提出了未来感知量化(Future-Aware Quantization,FAQ),该方法利用未来层激活值来指导量化,从而更好地识别和保留重要权重,同时降低对校准噪声的敏感性。我们进一步引入窗口级预览机制,以柔和地聚合多个未来层激活,缓解对单一层的过度依赖。为避免昂贵的贪心搜索,我们使用预先搜索的配置来最小化开销。实验表明,FAQ 在几乎没有额外成本的情况下 consistently 优于先前方法,无需反向传播、数据重构或调参,非常适合边缘部署。

关键词

引用

@article{arxiv.2602.02538,
  title  = {Enhancing Post-Training Quantization via Future Activation Awareness},
  author = {Zheqi Lv and Zhenxuan Fan and Qi Tian and Wenqiao Zhang and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2602.02538},
  year   = {2026}
}