中文

MoMa: 调制 Mamba 以适配图像基础模型进行视频识别

计算机视觉与模式识别 2025-07-01 v1

摘要

视频理解是需要有效建模空间时间动态性的复杂任务。随着图像基础模型(IFMs)在图像理解方面的成功,最近的研究方法探索了参数高效微调(PEFT)以适配 IFMs 用于视频。然而,这些方法大多倾向于分别处理空间和时间信息,可能无法捕捉视频动态的完整复杂性。本文提出了 MoMa,一个高效的适配器框架,通过将 Mamba 的选择性状态空间建模集成到 IFMs 中,实现完整的空间时间建模。我们提出了一种新的 SeqMod 操作,将空间时间信息注入预训练的 IFMs,而不会干扰其原始特征。通过将 SeqMod 纳入分治-调制架构,MoMa 在保持计算效率的同时增强了视频理解能力。在多个视频基准上的大量实验表明,MoMa 的有效性,实现了性能卓越且计算成本降低。

关键词

引用

@article{arxiv.2506.23283,
  title  = {MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition},
  author = {Yuhuan Yang and Chaofan Ma and Zhenjie Mao and Jiangchao Yao and Ya Zhang and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2506.23283},
  year   = {2025}
}

备注

ICML 2025 paper