中文

PTQ4VM:面向Visual Mamba的后训练量化

计算机视觉与模式识别 2025-04-08 v2 机器学习

摘要

Visual Mamba是一种将选择性空间状态模型Mamba扩展到视觉任务的方法。它以固定顺序处理图像标记,逐步累积信息以生成输出。尽管Visual Mamba因其在各种任务中以低计算成本提供高质量输出而日益受到欢迎,但其高度易受量化影响,使进一步的性能提升变得具有挑战性。我们的分析揭示,Visual Mamba中固定的标记访问顺序引入了独特的量化挑战,这些挑战可归类为三个主要问题:1)标记级方差,2)通道级异常值,3)激活值的长尾分布。为解决这些挑战,我们提出面向Visual Mamba的后训练量化方法(Post-Training Quantization for Visual Mamba, PTQ4VM),该方法引入两种关键策略:Per-Token Static(PTS)量化和Joint Learning of Smoothing Scale and Step Size(JLSS)。据我们了解,这是首个针对Visual Mamba的量化研究。PTQ4VM可应用于各种Visual Mamba骨干网络,在不显著损失质量的前提下,将预训练模型转换为量化格式,转换时间不足15分钟。在大规模分类和回归任务上的广泛实验表明,其有效性,实现了在GPU上最高可达1.83倍的加速,相较于FP16精度损失可忽略。我们的代码可在https://github.com/YoungHyun197/ptq4vm 获取。

关键词

引用

@article{arxiv.2412.20386,
  title  = {PTQ4VM: Post-Training Quantization for Visual Mamba},
  author = {Younghyun Cho and Changhun Lee and Seonggon Kim and Eunhyeok Park},
  journal= {arXiv preprint arXiv:2412.20386},
  year   = {2025}
}

备注

Accepted at WACV 2025 (oral presentation)