MS-Temba: 用于理解长未修剪视频的多尺度时间Mamba
计算机视觉与模式识别
2025-12-18 v3
摘要
未修剪视频中的时序动作检测(TAD)提出了重大挑战,特别是对于日常生活活动(ADL),要求模型(1)处理长视频,(2)捕捉动作的时间变化,以及(3)同时检测密集重叠的动作。现有的基于CNN和Transformer的方法难以同时捕捉细粒度细节和大尺度上的长程结构。基于状态空间模型(SSM)的Mamba提供了强大的长程建模能力,但直接应用于TAD会破坏细粒度时间结构,并且无法解决TAD固有的挑战。为此,我们提出了多尺度时间Mamba(MS-Temba),它通过新引入的扩张SSM将Mamba扩展到TAD。每个Temba块由扩张SSM与我们提出的额外损失函数耦合,能够学习跨时间尺度的判别性表示。轻量级的多尺度Mamba融合器随后通过基于SSM的聚合统一这些多尺度特征,产生精确的动作边界定位。仅用17M参数,MS-Temba在密集标注的ADL基准TSU和Charades上取得了最先进的性能,并进一步泛化到长视频摘要,在TVSum和SumMe上创造了新的最先进结果。
引用
@article{arxiv.2501.06138,
title = {MS-Temba: Multi-Scale Temporal Mamba for Understanding Long Untrimmed Videos},
author = {Arkaprava Sinha and Monish Soundar Raj and Pu Wang and Ahmed Helmy and Hieu Le and Srijan Das},
journal= {arXiv preprint arXiv:2501.06138},
year = {2025}
}