中文

用于视频时序动作定位的图卷积模块

计算机视觉与模式识别 2021-12-02 v1

摘要

时序动作定位在计算机视觉中已被长期研究。现有最先进的动作定位方法将每个视频划分为多个动作单元(即两阶段方法中的提议和单阶段方法中的片段),然后分别对每个单元进行动作识别/回归,在学习过程中未显式利用它们之间的关系。本文中,我们主张动作单元之间的关系在动作定位中起重要作用,更强大的动作检测器不仅应捕获每个动作单元的局部内容,还应允许对其相关上下文有更广阔的视野。为此,我们提出了一种通用图卷积模块(GCM),可轻松插入现有动作定位方法中,包括两阶段和单阶段范式。具体而言,我们首先构建图,其中每个动作单元表示为节点,两个动作单元之间的关系表示为边。此处我们使用两类关系,一类用于捕获不同动作单元间的时间连接,另一类用于刻画其语义关系。特别是对于两阶段方法中的时间连接,我们进一步探索了两类不同的边,一类连接重叠的动作单元,另一类连接周围但不相交的单元。基于所建图,我们应用图卷积网络(GCNs)建模不同动作单元间的关系,能够学习更具信息的表示以增强动作定位。实验结果表明,我们的GCM持续提升了现有动作定位方法的性能,包括两阶段方法(如CBR和R-C3D)和单阶段方法(如D-SSAD),验证了GCM的通用性与有效性。

关键词

引用

@article{arxiv.2112.00302,
  title  = {Graph Convolutional Module for Temporal Action Localization in Videos},
  author = {Runhao Zeng and Wenbing Huang and Mingkui Tan and Yu Rong and Peilin Zhao and Junzhou Huang and Chuang Gan},
  journal= {arXiv preprint arXiv:2112.00302},
  year   = {2021}
}

备注

Accepted by T-PAMI