用于改进Vision Mamba训练的随机逐层打乱
计算机视觉与模式识别
2025-06-03 v2
摘要
近期Vision Mamba (Vim)模型在序列长度上表现出近线性的复杂度,使其在处理视觉数据方面极具吸引力。然而,其训练方法及潜力仍未得到充分探索。本文研究了Vim的训练策略,并提出了随机逐层打乱,这是一种能有效改进Vim训练的新型正则化方法。无需架构修改,该方法即可使非分层Vim在ImageNet-1K上获得优于同类模型的领先性能。我们的方法每层通过四个简单步骤执行:通过概率分配设定依赖层的打乱率,通过伯努利试验进行操作采样,对输入token进行序列打乱,以及恢复输出的顺序。SLWS通过三个原则彰显其特色:\textit{(1) 即插即用:}无需架构修改,且在推理期间停用。\textit{(2) 简单但有效:}四步过程仅引入随机置换和可忽略的开销。\textit{(3) 直观设计:}打乱概率随层深线性增长,与视觉模型中的分层语义抽象相一致。我们的工作强调了为Vim模型量身定制训练策略的重要性,并为探索其可扩展性提供了有益途径。
关键词
引用
@article{arxiv.2408.17081,
title = {Stochastic Layer-Wise Shuffle for Improving Vision Mamba Training},
author = {Zizheng Huang and Haoxing Chen and Jiaqi Li and Jun Lan and Huijia Zhu and Weiqiang Wang and Limin Wang},
journal= {arXiv preprint arXiv:2408.17081},
year = {2025}
}
备注
accpeted to ICML25