中文

MambaTAD:当状态空间模型遇见长范围时序动作检测

计算机视觉与模式识别 2026-03-06 v2 人工智能

摘要

时序动作检测(TAD)旨在通过确定动作在未剪辑视频中的起始和结束帧来识别并定位动作。最近的结构化状态空间模型(如 Mamba)因其长程建模能力和线性计算复杂度而在 TAD 中显示出潜力。另一方面,结构化状态空间模型在 TAD 中面临两个关键挑战:由于递归处理导致的时序上下文衰减,以及在全局视觉上下文建模期间的自元素冲突,这在处理长时段动作实例时尤为严重。此外,传统方法因缺乏全局意识和低效检测头而难以检测长时段动作实例。本文提出MambaTAD,这是一种新的状态空间 TAD 模型,引入长程建模和全局特征检测能力,以实现准确的时序动作检测。MambaTAD 由两种互补设计构成,性能卓越。首先,它引入对角遮蔽双向状态空间(DMBSS)模块,有效促进全局特征融合和时序动作检测。其次,它引入全局特征融合头,通过多粒度特征和全局意识进行检测细化。此外,MambaTAD 采用新的状态空间时序适配器(SSTA)以端到端方式进行 TAD,线性复杂度降低网络参数和计算成本。广泛实验表明,MambaTAD 在多个公开基准测试上始终实现卓越的 TAD 性能。

关键词

引用

@article{arxiv.2511.17929,
  title  = {MambaTAD: When State-Space Models Meet Long-Range Temporal Action Detection},
  author = {Hui Lu and Yi Yu and Shijian Lu and Deepu Rajan and Boon Poh Ng and Alex C. Kot and Xudong Jiang},
  journal= {arXiv preprint arXiv:2511.17929},
  year   = {2026}
}