通过合并 Token 再训练在几分钟内重建更快的 Vision Mamba
计算机视觉与模式识别
2025-04-15 v4 人工智能
摘要
Vision Mamba 在计算机视觉任务中表现出接近 SOTA 的性能,引发了人们对提升其效率的浓厚兴趣。一种有前景的方法是 token 缩减(该方法已在 ViT 中成功实现)。在 Mamba 中剪枝包含信息的 token 会导致关键知识的大量丢失和性能下降。另一种方法——token 合并——虽然比剪枝保留了更多信息,但在大压缩比下同样存在问题。我们的核心洞察是,在 token 合并后进行一轮快速再训练,可以在各种压缩比下产生稳健的结果。根据实验,被剪枝的 Vim 在 ImageNet-1K 上的准确率仅下降不超过 0.9%,并在我们提出的 R-MeeTo 框架的主要评估中得以恢复。我们展示了如何在分钟级别实现简单有效的快速恢复,特别是在 Vim-Ti 上经过 3 个 epoch 的训练,准确率飙升了 35.9%。此外,Vim-Ti/S/B 在 5/7/17 分钟内完成再训练,而 Vim-S 在推理速度提升 1.2 倍(最高 1.5 倍)的情况下,准确率仅下降 1.3%。
引用
@article{arxiv.2412.12496,
title = {Faster Vision Mamba is Rebuilt in Minutes via Merged Token Re-training},
author = {Mingjia Shi and Yuhao Zhou and Ruiji Yu and Zekai Li and Zhiyuan Liang and Xuanlei Zhao and Xiaojiang Peng and Shanmukha Ramakrishna Vedantam and Wangbo Zhao and Kai Wang and Yang You},
journal= {arXiv preprint arXiv:2412.12496},
year = {2025}
}