中文

You Only Watch Once:一种用于实时时空动作定位的统一 CNN 架构

计算机视觉与模式识别 2021-10-19 v5

摘要

时空动作定位需要将两种信息源纳入所设计的架构中:(1)来自先前帧的时间信息,以及(2)来自关键帧的空间信息。当前最先进的方法通常用分离的网络提取这些信息,并使用额外的融合机制来获得检测结果。在本工作中,我们提出 YOWO,一种用于视频流中实时时空动作定位的统一 CNN 架构。YOWO 是一个单阶段架构,具有两个分支以并行提取时间与空间信息,并在一次推断中直接从视频片段预测边界框与动作概率。由于整个架构是统一的,它可被端到端优化。YOWO 架构速度很快,在 16 帧输入片段上提供每秒 34 帧,在 8 帧输入片段上提供每秒 62 帧,这是目前时空动作定位任务上最快的最先进架构。值得注意的是,YOWO 在 J-HMDB-21 与 UCF101-24 上分别以约 3% 和约 12% 的显著提升优于先前的最先进结果。此外,YOWO 是首个也是唯一一个在 AVA 数据集上提供有竞争力结果的单阶段架构。我们公开了代码与预训练模型。

关键词

引用

@article{arxiv.1911.06644,
  title  = {You Only Watch Once: A Unified CNN Architecture for Real-Time Spatiotemporal Action Localization},
  author = {Okan Köpüklü and Xiangyu Wei and Gerhard Rigoll},
  journal= {arXiv preprint arXiv:1911.06644},
  year   = {2021}
}