中文

使用状态空间Transformer的高效电影场景检测

计算机视觉与模式识别 2023-06-23 v2

摘要

区分不同电影场景的能力对于理解电影故事情节至关重要。然而,准确检测电影场景通常具有挑战性,因为它需要对非常长的电影片段进行推理。这与大多数现有的视频识别模型形成对比,后者通常设计用于短程视频分析。本工作提出一种状态空间Transformer模型,可高效捕获长电影视频中的依赖关系以实现准确的电影场景检测。我们的模型称为 TranS4mer,使用新颖的 S4A 构建块构建,该块结合了结构化状态空间序列(S4)和自注意力(A)层的优势。给定划分为电影镜头(摄像机位置不发生变化的连续时段)的帧序列,S4A 块首先应用自注意力来捕获短程镜头内依赖关系。随后,S4A 块中的状态空间操作用于聚合长程镜头间线索。最终的 TranS4mer 模型通过多次依次堆叠 S4A 块获得,可进行端到端训练。我们提出的 TranS4mer 在三个电影场景检测数据集(包括 MovieNet、BBC 和 OVSD)上优于所有先前方法,同时比标准 Transformer 模型快 2×2\times 且所需 GPU 内存少 3×3\times。我们将发布代码和模型。

关键词

引用

@article{arxiv.2212.14427,
  title  = {Efficient Movie Scene Detection using State-Space Transformers},
  author = {Md Mohaiminul Islam and Mahmudul Hasan and Kishan Shamsundar Athrey and Tony Braskich and Gedas Bertasius},
  journal= {arXiv preprint arXiv:2212.14427},
  year   = {2023}
}

备注

Accepted by CVPR 2023. Code: https://github.com/md-mohaiminul/TranS4mer