中文

STFCN:用于语义视频分割的时空全卷积网络

计算机视觉与模式识别 2016-09-05 v2

摘要

本文提出了一种结合空间和时间特征进行语义视频分割的新方法。当前关于卷积神经网络(CNNs)的研究表明,CNNs 提供了先进的空间特征,为图像和视频分析任务,特别是语义分割任务,提供了非常好的性能支持。我们研究了引入时间特征如何也对视频数据分割产生良好效果。我们提出了一个基于循环神经网络中长短期记忆(LSTM)架构的模块,用于解释视频帧随时间变化的时间特性。我们的系统以视频帧作为输入,并产生相应大小的输出;为了分割视频,我们的方法结合使用了三个组件:首先,使用 CNN 提取帧的区域空间特征;然后,利用 LSTM 添加时间特征;最后,通过对时空特征进行反卷积,我们产生像素级的预测。我们的核心见解是构建具有端到端架构的时空卷积网络(spatio-temporal CNNs)用于语义视频分割。我们将一些已知的卷积网络架构(如 FCN-AlexNet 和 FCN-VGG16)以及空洞卷积完全适配到我们的时空卷积网络中。我们的时空卷积网络在 Camvid 和 NYUDv2 数据集上实现了最先进的语义分割性能。

关键词

引用

@article{arxiv.1608.05971,
  title  = {STFCN: Spatio-Temporal FCN for Semantic Video Segmentation},
  author = {Mohsen Fayyaz and Mohammad Hajizadeh Saffar and Mohammad Sabokrou and Mahmood Fathy and Reinhard Klette and Fay Huang},
  journal= {arXiv preprint arXiv:1608.05971},
  year   = {2016}
}