中文

MS-Temba: 用于理解长未修剪视频的多尺度时间Mamba

计算机视觉与模式识别 2025-12-18 v3

摘要

未修剪视频中的时序动作检测(TAD)提出了重大挑战,特别是对于日常生活活动(ADL),要求模型(1)处理长视频,(2)捕捉动作的时间变化,以及(3)同时检测密集重叠的动作。现有的基于CNN和Transformer的方法难以同时捕捉细粒度细节和大尺度上的长程结构。基于状态空间模型(SSM)的Mamba提供了强大的长程建模能力,但直接应用于TAD会破坏细粒度时间结构,并且无法解决TAD固有的挑战。为此,我们提出了多尺度时间Mamba(MS-Temba),它通过新引入的扩张SSM将Mamba扩展到TAD。每个Temba块由扩张SSM与我们提出的额外损失函数耦合,能够学习跨时间尺度的判别性表示。轻量级的多尺度Mamba融合器随后通过基于SSM的聚合统一这些多尺度特征,产生精确的动作边界定位。仅用17M参数,MS-Temba在密集标注的ADL基准TSU和Charades上取得了最先进的性能,并进一步泛化到长视频摘要,在TVSum和SumMe上创造了新的最先进结果。

关键词

引用

@article{arxiv.2501.06138,
  title  = {MS-Temba: Multi-Scale Temporal Mamba for Understanding Long Untrimmed Videos},
  author = {Arkaprava Sinha and Monish Soundar Raj and Pu Wang and Ahmed Helmy and Hieu Le and Srijan Das},
  journal= {arXiv preprint arXiv:2501.06138},
  year   = {2025}
}