跃过局部极小:视觉 Transformer 损失景观中的量化
计算机视觉与模式识别
2024-09-27 v3
摘要
量化尺度与位宽是考虑如何量化神经网络时最重要的参数。先前工作聚焦于通过梯度方法(梯度下降与 Hessian 分析)以全局方式优化量化尺度。然而,当对量化尺度施加扰动时,我们观察到高度锯齿状、极不平滑的测试损失景观。事实上,量化尺度上的微小扰动可极大影响准确率,在 4 位量化的视觉 Transformer(ViT)中带来 的准确率提升。在此情形下,梯度方法失效,因为它们无法可靠地到达局部极小。在我们称为 Evol-Q 的工作中,我们使用进化搜索来有效遍历非平滑景观。此外,我们提出使用 infoNCE 损失,其不仅有助于在小校准数据集( 张图像)上对抗过拟合,还使遍历如此高度非平滑的表面更为容易。Evol-Q 将全量化 ViT-Base 在 位、 位和 位权重量化水平下的 top-1 准确率分别提升 、 和 。在多种 CNN 与 ViT 架构上的大量实验进一步证明了其在极端量化场景下的鲁棒性。我们的代码见 https://github.com/enyac-group/evol-q
引用
@article{arxiv.2308.10814,
title = {Jumping through Local Minima: Quantization in the Loss Landscape of Vision Transformers},
author = {Natalia Frumkin and Dibakar Gope and Diana Marculescu},
journal= {arXiv preprint arXiv:2308.10814},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2211.09643