中文

跃过局部极小:视觉 Transformer 损失景观中的量化

计算机视觉与模式识别 2024-09-27 v3

摘要

量化尺度与位宽是考虑如何量化神经网络时最重要的参数。先前工作聚焦于通过梯度方法(梯度下降与 Hessian 分析)以全局方式优化量化尺度。然而,当对量化尺度施加扰动时,我们观察到高度锯齿状、极不平滑的测试损失景观。事实上,量化尺度上的微小扰动可极大影响准确率,在 4 位量化的视觉 Transformer(ViT)中带来 0.50.8%0.5-0.8\% 的准确率提升。在此情形下,梯度方法失效,因为它们无法可靠地到达局部极小。在我们称为 Evol-Q 的工作中,我们使用进化搜索来有效遍历非平滑景观。此外,我们提出使用 infoNCE 损失,其不仅有助于在小校准数据集(1,0001,000 张图像)上对抗过拟合,还使遍历如此高度非平滑的表面更为容易。Evol-Q 将全量化 ViT-Base 在 33 位、44 位和 88 位权重量化水平下的 top-1 准确率分别提升 10.30%10.30\%0.78%0.78\%0.15%0.15\%。在多种 CNN 与 ViT 架构上的大量实验进一步证明了其在极端量化场景下的鲁棒性。我们的代码见 https://github.com/enyac-group/evol-q

关键词

引用

@article{arxiv.2308.10814,
  title  = {Jumping through Local Minima: Quantization in the Loss Landscape of Vision Transformers},
  author = {Natalia Frumkin and Dibakar Gope and Diana Marculescu},
  journal= {arXiv preprint arXiv:2308.10814},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2211.09643