中文

G-TAD:用于时序动作检测的子图定位

计算机视觉与模式识别 2020-04-06 v2

摘要

时序动作检测是视频理解中基础且具有挑战性的任务。视频上下文是有效检测动作的关键线索,但现有工作主要关注时间上下文,忽视了语义上下文及其他重要上下文属性。本工作中,我们提出一种图卷积网络(GCN)模型,自适应地将多层次语义上下文融入视频特征,并将时序动作检测视为子图定位问题。具体而言,我们将视频片段表示为图节点,片段-片段关联表示为边,与上下文关联的动作表示为目标子图。以图卷积为基本操作,我们设计了一个称为 GCNeXt 的 GCN 模块,通过聚合各节点上下文并动态更新图中边来学习节点特征。为定位每个子图,我们还设计了 SGAlign 层将每个子图嵌入欧几里得空间。大量实验表明,G-TAD 无需额外监督即可发现有效视频上下文,并在两个检测基准上取得最先进性能。在 ActivityNet-1.3 上,其平均 mAP 达 34.09%;在 THUMOS14 上,结合提议处理方法在 [email protected] 下达到 51.6%。G-TAD 代码公开于 https://github.com/frostinassiky/gtad。

关键词

引用

@article{arxiv.1911.11462,
  title  = {G-TAD: Sub-Graph Localization for Temporal Action Detection},
  author = {Mengmeng Xu and Chen Zhao and David S. Rojas and Ali Thabet and Bernard Ghanem},
  journal= {arXiv preprint arXiv:1911.11462},
  year   = {2020}
}

备注

Accepted by CVPR2020. 8 pages, 9 figures, 2 pages appendix