中文

用于时空动作定位的动作管段检测器

计算机视觉与模式识别 2017-08-22 v3

摘要

当前最先进的时空动作定位方法依赖于帧级别的检测,随后跨时间进行关联或跟踪。本文中,我们利用视频的时间连续性,而非在帧级别操作。我们提出动作管段检测器(ACtion Tubelet detector, ACT-detector),其以帧序列作为输入,输出管段(tubelets),即带有相关分数的边界框序列。正如最先进的目标检测器依赖于锚框,我们的ACT-detector基于锚立体框(anchor cuboids)。我们构建于SSD框架之上。对每帧提取卷积特征,而分数和回归基于这些特征的时间堆叠,从而利用序列中的信息。我们的实验结果表明,利用帧序列相比使用单帧显著提升了检测性能。我们的管段检测器的增益可归因于更准确的分数和更精确的定位。我们的ACT-detector在J-HMDB和UCF-101数据集上针对frame-mAP和video-mAP超越了最先进的方法,尤其是在高重叠阈值下。

关键词

引用

@article{arxiv.1705.01861,
  title  = {Action Tubelet Detector for Spatio-Temporal Action Localization},
  author = {Vicky Kalogeiton and Philippe Weinzaepfel and Vittorio Ferrari and Cordelia Schmid},
  journal= {arXiv preprint arXiv:1705.01861},
  year   = {2017}
}

备注

9 pages