中文

用于时序动作提案生成的带自适应图增强Transformer

计算机视觉与模式识别 2021-03-31 v1

摘要

时序动作提案生成(TAPG)是视频理解尤其是时序动作检测中一项基础且具有挑战性的任务。大多数先前工作聚焦于捕捉局部时序上下文,能够较好定位具有干净帧和清晰边界的简单动作实例。然而,在感兴趣动作包含无关帧和背景杂波、局部时序上下文效果变弱的复杂场景中,它们通常表现不佳。为应对这些问题,我们提出一种带自适应图网络的增强transformer(ATAG),以利用长程和局部时序上下文进行TAPG。具体而言,我们通过配备片段动作性损失和一个前端模块来增强原始transformer,称为增强transformer,其提升了捕捉长程依赖和学习噪声动作实例鲁棒特征的能力。此外,提出一种自适应图卷积网络(GCN),通过挖掘相邻特征间的位置信息和差异来构建局部时序上下文。来自两个模块的特征携带丰富的视频语义信息,并被融合以进行有效序列提案生成。在两个具挑战性数据集THUMOS14和ActivityNet1.3上进行了大量实验,结果表明我们的方法优于最先进的TAPG方法。我们的代码将很快发布。

关键词

引用

@article{arxiv.2103.16024,
  title  = {Augmented Transformer with Adaptive Graph for Temporal Action Proposal Generation},
  author = {Shuning Chang and Pichao Wang and Fan Wang and Hao Li and Jiashi Feng},
  journal= {arXiv preprint arXiv:2103.16024},
  year   = {2021}
}

备注

12 pagess, 4 figures