中文

Vision Transformer 的混合非线性量化

计算机视觉与模式识别 2025-06-05 v2 人工智能

摘要

大多数量化方法都旨在减少 Vision Transformer 的模型大小,但大多数方法忽略了非线性运算的量化。只有少数工作针对非线性运算的量化,但它们对所有非线性运算应用单一的量化方法。我们认为可以通过为每个非线性运算采用不同的方法来进一步改进。因此,为了为每个非线性层分配最能最小化误差的已知量化方法,我们提出了一种考虑由 SQNR 差异度量衡量的层级量化敏感性的混合非线性量化方法。结果表明,在 ViT、DeiT 和 Swin 模型的 8 位和 6 位设置下,我们的方法在 I-BERT、FQ-ViT 和 I-ViT 方面平均提高了 0.6%p 和 19.6%p。在训练时间受限时,我们的方法在 I-BERT 和 I-ViT 方面分别提高了 0.6%p 和 20.8%p。我们计划在 https://gitlab.com/ones-ai/mixed-non-linear-quantization 上发布代码。

关键词

引用

@article{arxiv.2407.18437,
  title  = {Mixed Non-linear Quantization for Vision Transformers},
  author = {Gihwan Kim and Jemin Lee and Sihyeong Park and Yongin Kwon and Hyungshin Kim},
  journal= {arXiv preprint arXiv:2407.18437},
  year   = {2025}
}

备注

16 pages, 4 figures, Accepted in ECCV Workshops 2024