S2D:面向量化友好神经激活的选择性谱衰减
机器学习
2026-02-17 v1 人工智能
机器学习
摘要
大规模 transformer 模型中的激活异常值是模型量化的一个根本性挑战,导致范围过大,在量化期间造成严重的精度下降。我们经验性地观察到,异常值程度随预训练规模而增加(例如,从 CLIP 到更广泛训练的 SigLIP 和 SigLIP2)。通过理论分析以及经验相关性研究,我们建立了这些激活异常值与权重最大奇异值之间的直接联系。基于这一洞察,我们提出了选择性谱衰减(),这是一种几何学上原则化的条件方法,通过在 fine-tuning 期间对仅对应最大奇异值的权重分量进行精准正则化。通过大量实验,我们证明 显著减少激活异常值,产生内在上条件且易于量化的表示。使用 训练的模型在 ImageNet 上进行 W4A4 量化的 PTQ 准确率提升最高可达 7%,结合 QAT 可获得 4% 的提升。这些改进也适用于下游任务和视觉语言模型,使我们能够在不牺牲部署效率的前提下扩展到越来越大的模型。
引用
@article{arxiv.2602.14432,
title = {S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activations},
author = {Arnav Chavan and Nahush Lele and Udbhav Bamba and Sankalp Dayal and Aditi Raghunathan and Deepak Gupta},
journal= {arXiv preprint arXiv:2602.14432},
year = {2026}
}