中文

用于视频动作识别的时空残差网络

计算机视觉与模式识别 2016-11-08 v1

摘要

双流卷积网络(ConvNets)在视频人体动作识别中展现出强劲性能。近来,残差网络(ResNets)作为一种训练极深架构的新技术而出现。本文中,我们提出时空残差网络(spatiotemporal ResNets)作为这两种方法的结合。我们的新颖架构通过两种方式引入残差连接,将ResNets推广至时空域。首先,我们在双流架构的外观与运动路径之间注入残差连接,以实现两流之间的时空交互。其次,我们通过为预训练图像ConvNets配备可学习的卷积滤波器,将其转化为时空网络,这些滤波器初始化为时间残差连接并在时间上相邻的特征图上进行操作。该方法随着模型深度增加缓慢扩大时空感受野,并自然整合了图像ConvNet设计原则。整个模型以端到端方式训练,以实现复杂时空特征的分层学习。我们使用两个广泛使用的动作识别基准评估了我们的新颖时空残差网络,其性能超越了先前的最先进水平。

关键词

引用

@article{arxiv.1611.02155,
  title  = {Spatiotemporal Residual Networks for Video Action Recognition},
  author = {Christoph Feichtenhofer and Axel Pinz and Richard P. Wildes},
  journal= {arXiv preprint arXiv:1611.02155},
  year   = {2016}
}

备注

NIPS 2016