中文

用于时序动作定位的视频自拼接图网络

计算机视觉与模式识别 2024-04-02 v4

摘要

视频中的时序动作定位(TAL)是一项具有挑战性的任务,尤其由于动作时间尺度的巨大差异。短动作通常在数据集中占较大比例,但性能往往最低。本文直面短动作的挑战,提出了一种称为视频自拼接图网络(VSGN)的多层级跨尺度解决方案。VSGN包含两个关键组件:视频自拼接(VSS)与跨尺度图金字塔网络(xGPN)。在VSS中,我们聚焦于视频的短时段并沿时间维度放大以获得更大尺度。我们将原始片段与其放大对应片段拼接于同一输入序列中,以利用两种尺度的互补特性。xGPN组件通过跨尺度图网络的金字塔进一步挖掘跨尺度关联,每个网络包含一个混合模块以聚合跨尺度以及同尺度内的特征。我们的VSGN不仅增强了特征表示,还为短动作生成了更多正锚框以及更多短训练样本。实验表明,VSGN明显提升了短动作的定位性能,同时在THUMOS-14与ActivityNet-v1.3上取得了最先进的总体性能。

关键词

引用

@article{arxiv.2011.14598,
  title  = {Video Self-Stitching Graph Network for Temporal Action Localization},
  author = {Chen Zhao and Ali Thabet and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2011.14598},
  year   = {2024}
}