中文

用于复杂动作识别的 Timeception

计算机视觉与模式识别 2019-04-30 v2

摘要

本文关注视频中人体活动识别的时间方面;这一重要的视觉线索长期被低估。我们重访活动的传统定义并将其限定为复杂动作:一组具有弱时间模式且服务于特定目的的单动作。相关作品使用具有固定核大小时空 3D 卷积,过于僵化以致无法捕捉复杂动作时间跨度的多样性,且过短而不利于长程时间建模。相反,我们使用多尺度时间卷积,并降低了 3D 卷积的复杂度。成果是 Timeception 卷积层,其推理约数分钟长的时间模式,比最佳相关作品长 8 倍。因此,Timeception 在识别 Charades、Breakfast Actions 和 MultiTHUMOS 的人体活动中取得了令人印象深刻的准确率。进一步,我们证明 Timeception 学习长程时间依赖并容忍复杂动作的时间跨度。

关键词

引用

@article{arxiv.1812.01289,
  title  = {Timeception for Complex Action Recognition},
  author = {Noureldien Hussein and Efstratios Gavves and Arnold W. M. Smeulders},
  journal= {arXiv preprint arXiv:1812.01289},
  year   = {2019}
}

备注

IEEE CVPR 2019 (Oral)