中文

基于残差帧与3D CNN的运动表示

计算机视觉与模式识别 2020-06-24 v1

摘要

近来,3D卷积网络(3D ConvNets)在动作识别中取得了良好性能。然而,仍需要光流流以确保更佳性能,其代价非常高昂。本文中,我们提出一种快速而有效的方式,利用残差帧作为3D ConvNets中的输入数据来从视频中提取运动特征。以残差帧替代传统的堆叠RGB帧,在从头训练ResNet-18模型时,于UCF101和HMDB51数据集上分别可获得超过top-1准确率35.6%和26.6%的提升。并且我们在该训练模式下取得了最先进(state-of-the-art)结果。分析表明,与RGB对应物相比,使用残差帧可提取更好的运动特征。通过与一条简单的表观路径结合,我们的方案甚至优于一些使用光流流的方法。

关键词

引用

@article{arxiv.2006.13017,
  title  = {Motion Representation Using Residual Frames with 3D CNN},
  author = {Li Tao and Xueting Wang and Toshihiko Yamasaki},
  journal= {arXiv preprint arXiv:2006.13017},
  year   = {2020}
}

备注

Accepted in IEEE ICIP 2020. arXiv admin note: substantial text overlap with arXiv:2001.05661