TinyViM:基于频率解耦的轻量化混合 Vision Mamba
计算机视觉与模式识别
2025-12-09 v2
摘要
Mamba 因其在输入长度上具有线性复杂度而在计算机视觉领域展现出巨大潜力。然而,现有的轻量级 Mamba 基础模型无法实现与卷积或 Transformer 方法相当的性能。我们观察到,仅修改图像域中的扫描路径并不利于充分发挥 Vision Mamba 的潜力。本文首先进行全面的谱分析和量化分析,验证在卷积-Mamba 混合架构下,Mamba 块主要建模低频信息。基于这些分析,我们引入一种新型的 Laplace mixer 来实现特征在频率和输入上的解耦,仅将低频分量输入 Mamba 块。此外,考虑到特征的冗余性以及不同阶段对高频细节和低频全局信息的不同需求,我们引入频率坡入 (frequency ramp inception),即逐渐减少高频分支的输入维度,从而在不同层之间高效地权衡高频和低频分量。通过集成移动友好型卷积和高效 Laplace mixer,我们构建了一系列称为 TinyViM 的小型混合 Vision Mamba。所提出的 TinyViM 在多个下游任务上实现了令人瞩目的性能,包括图像分类、语义分割、目标检测和实例分割。特别是,TinyViM 在规模相当的卷积、Transformer 和 Mamba 模型中取得了优异性能,其吞吐量约为其他 Mamba 模型的 2-3 倍。代码已公开 https://github.com/xwmaxwma/TinyViM。
引用
@article{arxiv.2411.17473,
title = {TinyViM: Frequency Decoupling for Tiny Hybrid Vision Mamba},
author = {Xiaowen Ma and Zhenliang Ni and Xinghao Chen},
journal= {arXiv preprint arXiv:2411.17473},
year = {2025}
}
备注
ICCV 2025