OuroMamba:面向 Vision Mamba 的无数据量化框架
计算机视觉与模式识别
2025-11-27 v2 人工智能
摘要
我们提出了 OuroMamba,这是首个面向 Vision Mamba 模型(VMMs)的无数据训练后量化(DFQ)方法。我们识别了在 VMMs 中实现 DFQ 的两个关键挑战:(1) VMM 的循环状态转移限制了对长程交互的捕捉,导致合成数据语义薄弱;(2) VMM 激活在各个时间步之间表现出动态的异常值变化,使得现有的静态 PTQ 技术失效。为了应对这些挑战,OuroMamba 提出了一个两阶段框架:(1) OuroMamba-Gen,用于生成语义丰富且有意义的合成数据。它在潜在状态空间中通过邻域交互生成的块级 VMM 特征上应用对比学习;(2) OuroMamba-Quant,在推理期间采用混合精度量化与轻量级动态异常值检测。具体而言,我们提出了一种基于阈值的激活异常值通道选择策略,该策略在每个时间步进行更新。在视觉和生成任务上的大量实验表明,我们无数据的 OuroMamba 超越了现有的数据驱动 PTQ 技术,在多种量化设置下取得了 SOTA 性能。此外,我们实现了高效的 GPU 内核,获得了高达 2.36 倍的实际延迟加速。代码和合成数据集可在此获取:https://github.com/georgia-tech-synergy-lab/ICCV-OuroMamba
引用
@article{arxiv.2503.10959,
title = {OuroMamba: A Data-Free Quantization Framework for Vision Mamba},
author = {Akshat Ramachandran and Mingyu Lee and Huan Xu and Souvik Kundu and Tushar Krishna},
journal= {arXiv preprint arXiv:2503.10959},
year = {2025}
}
备注
Accepted to ICCV 2025