跨层标记融合的快速视觉 Mamba 模型 Famba-V
计算机视觉与模式识别
2024-10-08 v3 人工智能
摘要
Mamba 和 Vision Mamba (Vim) 模型表现出作为 Transformer 架构替代方法的潜力。本工作引入 Fast Mamba for Vision (Famba-V),一种跨层标记融合技术,用于增强 Vim 模型的训练效率。Famba-V 的核心思想是基于一套跨层策略识别并融合不同 Vim 层之间的相似标记,而非仅在现有工作提出的所有层上均匀应用标记融合。我们在 CIFAR-100 上评估了 Famba-V 的性能。结果表明,Famba-V 能够通过减少训练时间和训练期间的峰值内存使用,提高 Vim 模型的训练效率。此外,提出的跨层策略使 Famba-V 能够在准确率与效率之间实现优越的权衡。这些结果共同表明,Famba-V 是 Vim 模型备受推崇的效率增强技术。
关键词
引用
@article{arxiv.2409.09808,
title = {Famba-V: Fast Vision Mamba with Cross-Layer Token Fusion},
author = {Hui Shen and Zhongwei Wan and Xin Wang and Mi Zhang},
journal= {arXiv preprint arXiv:2409.09808},
year = {2024}
}
备注
Camera ready version of ECCV 2024 Workshop on Computational Aspects of Deep Learning (Best Paper Award)