用于时序动作定位的视频自拼接图网络
计算机视觉与模式识别
2024-04-02 v4
摘要
视频中的时序动作定位(TAL)是一项具有挑战性的任务,尤其由于动作时间尺度的巨大差异。短动作通常在数据集中占较大比例,但性能往往最低。本文直面短动作的挑战,提出了一种称为视频自拼接图网络(VSGN)的多层级跨尺度解决方案。VSGN包含两个关键组件:视频自拼接(VSS)与跨尺度图金字塔网络(xGPN)。在VSS中,我们聚焦于视频的短时段并沿时间维度放大以获得更大尺度。我们将原始片段与其放大对应片段拼接于同一输入序列中,以利用两种尺度的互补特性。xGPN组件通过跨尺度图网络的金字塔进一步挖掘跨尺度关联,每个网络包含一个混合模块以聚合跨尺度以及同尺度内的特征。我们的VSGN不仅增强了特征表示,还为短动作生成了更多正锚框以及更多短训练样本。实验表明,VSGN明显提升了短动作的定位性能,同时在THUMOS-14与ActivityNet-v1.3上取得了最先进的总体性能。
引用
@article{arxiv.2011.14598,
title = {Video Self-Stitching Graph Network for Temporal Action Localization},
author = {Chen Zhao and Ali Thabet and Bernard Ghanem},
journal= {arXiv preprint arXiv:2011.14598},
year = {2024}
}