中文

一种用于视频中动作/物体分割的高效三维卷积神经网络

计算机视觉与模式识别 2019-07-23 v1 图像与视频处理

摘要

基于卷积神经网络(CNN)的图像分割近年来取得重大进展。然而,视频物体分割因其高计算复杂度仍具挑战性。以往多数方法采用双流 CNN 框架分别处理空间与运动特征。本文中,我们提出一种端到端编码器-解码器风格的三维 CNN,以同时聚合空间与时间信息用于视频物体分割。为高效处理视频,我们针对金字塔池化模块与解码器提出三维可分离卷积,在保持性能的同时大幅降低运算量。此外,我们还通过添加额外分类器以预测视频中主体的动作标签,将框架扩展至视频动作分割。在多个视频数据集上的大量实验表明,所提方法在动作与物体分割上相较最先进水平具有优越性能。

关键词

引用

@article{arxiv.1907.08895,
  title  = {An Efficient 3D CNN for Action/Object Segmentation in Video},
  author = {Rui Hou and Chen Chen and Rahul Sukthankar and Mubarak Shah},
  journal= {arXiv preprint arXiv:1907.08895},
  year   = {2019}
}