中文

MSF-Mamba:基于运动感知状态融合的高效微动作识别

计算机视觉与模式识别 2025-10-17 v2

摘要

微动作识别(MGR)旨在识别细微且细粒度的人类运动,需要准确建模长程和局部时空依赖关系。虽然 CNN 在捕获局部模式方面有效,但因受限的感受野难以处理长程依赖关系。基于自注意力机制的 Transformer 模型通过自注意力机制克服了这一限制,但又因计算成本高而受制于此。最近,Mamba 作为一种高效模型,利用状态空间模型(SSM)实现线性时间处理,展现出巨大的潜力。然而,直接将纯粹的 Mamba 应用于 MGR 可能并非最佳,因为 Mamba 将输入处理为 1D 序列,状态更新仅依赖前一状态,从而缺乏建模局部时空依赖关系的能力。此外,现有方法缺乏运动感知设计,这在 MGR 中至关重要。为克服这些局限性,我们提出了运动感知状态融合 mamba(MSF-Mamba),通过融合局部上下文相邻状态来增强 Mamba 的局部时空建模能力。我们的设计基于中心帧差(CFD)引入运动感知状态融合模块。进一步提出了名为 MSF-Mamba+ 的多尺度版本。具体而言,MSF-Mamba 支持多尺度运动感知状态融合,以及一种自适应尺度加权模块,用于动态加权不同尺度上浓缩状态。这些增强显著性地解决了纯粹 Mamba 的局限性,通过实现运动感知的局部时空建模,使 MSF-Mamba 能够有效捕获微小运动线索用于 MGR。在两个公开的 MGR 数据集上进行实验表明,轻量级版本即 MSF-Mamba 达到了 SoTA 性能,超越了现有的 CNN、Transformer 和 SSM 基础模型,同时保持了高效。

关键词

引用

@article{arxiv.2510.10478,
  title  = {MSF-Mamba: Motion-aware State Fusion Mamba for Efficient Micro-Gesture Recognition},
  author = {Deng Li and Jun Shao and Bohao Xing and Rong Gao and Bihan Wen and Heikki Kälviäinen and Xin Liu},
  journal= {arXiv preprint arXiv:2510.10478},
  year   = {2025}
}