中文

面向动作定位的深度概念级时序卷积网络

计算机视觉与模式识别 2019-08-27 v1

摘要

现有动作定位方法在从视频帧提取的 1D 特征图上采用浅层时序卷积网络(即 TCN)。本文经实证发现,堆叠更多常规时序卷积层反而会恶化动作分类性能,可能归因于 1D 特征图的所有通道(通常高度抽象并可视为潜在概念)在时序卷积中被过度重组。为解决此问题,我们引入一种新颖的概念级时序卷积(CTC)层,作为常规时序卷积层的替代以训练更深的动作定位网络。CTC 层不对潜在概念进行重组,而是为每个概念分别部署若干时序滤波器,并在概念间共享滤波器参数。从而可捕获不同概念的共同时序模式并显著丰富表征能力。通过堆叠 CTC 层,我们提出了深度概念级时序卷积网络(C-TCN),在 THUMOS'14 上将最优动作定位性能从 mAP(%) 42.8 提升至 52.1,取得 21.7% 的相对提升。在 ActivityNet 上也获得了良好结果。

关键词

引用

@article{arxiv.1908.09442,
  title  = {Deep Concept-wise Temporal Convolutional Networks for Action Localization},
  author = {Xin Li and Tianwei Lin and Xiao Liu and Chuang Gan and Wangmeng Zuo and Chao Li and Xiang Long and Dongliang He and Fu Li and Shilei Wen},
  journal= {arXiv preprint arXiv:1908.09442},
  year   = {2019}
}