中文

CSTA:基于 CNN 的时空注意力视频摘要方法

计算机视觉与模式识别 2024-05-22 v2

摘要

视频摘要旨在生成视频的简洁表示,捕捉其核心内容和关键时刻,同时缩短其整体长度。尽管已有多种方法采用注意力机制来处理长程依赖,但它们往往无法捕捉帧中固有的视觉显著性。为解决这一局限性,我们提出了一种基于 CNN 的时空注意力(CSTA)方法,该方法将单个视频中各帧的特征堆叠以形成类图像的帧表示,并将 2D CNN 应用于这些帧特征。该方法依赖 CNN 来理解帧间与帧内关系,并利用其在图像中学习绝对位置的能力来发现视频中的关键属性。与以往通过设计额外模块以关注空间重要性从而牺牲效率的工作不同,CSTA 将 CNN 用作滑动窗口,仅需极小的计算开销。在两个基准数据集(SumMe 和 TVSum)上的大量实验表明,与以往方法相比,所提方法以更少的 MACs 实现了 SOTA 性能。代码可在 https://github.com/thswodnjs3/CSTA 获取。

关键词

引用

@article{arxiv.2405.11905,
  title  = {CSTA: CNN-based Spatiotemporal Attention for Video Summarization},
  author = {Jaewon Son and Jaehun Park and Kwangsu Kim},
  journal= {arXiv preprint arXiv:2405.11905},
  year   = {2024}
}

备注

Accepted at CVPR 2024