中文

用于视频分割的卷积门控循环网络

计算机视觉与模式识别 2016-11-23 v2

摘要

语义分割最近取得了重大进展,其中全卷积神经网络已展现出良好性能。然而,以往的大部分工作都专注于改进单幅图像分割。据我们所知,尚无先前工作将视频时序信息用于循环网络。在本文中,我们引入了一种新颖的方法,隐式地利用视频中的时序数据进行在线语义分割。该方法依赖于一个嵌入到门控循环架构中的全卷积网络。此设计接收一系列连续视频帧,并输出最后一帧的分割结果。循环部分使用卷积门控循环网络来保持图像中的空间连通性。我们提出的方法可应用于在线和批量分割。该架构在二值和语义视频分割任务上均进行了测试。实验在 SegTrack V2、Davis、CityScapes 和 Synthia 的最新基准上进行。使用循环全卷积网络在我们所有实验中均提升了基线网络性能。即,在 SegTrack2 和 Davis 上 F-measure 分别提升了 5% 和 3%,在 Synthia 上平均 IoU 提升了 5.7%,在 CityScapes 上分类平均 IoU 提升了 3.5%。RFCN 网络的性能取决于其基线全卷积网络。因此,RFCN 架构可被视为一种通过利用视频中的时空信息来改进其基线分割网络的方法。

关键词

引用

@article{arxiv.1611.05435,
  title  = {Convolutional Gated Recurrent Networks for Video Segmentation},
  author = {Mennatullah Siam and Sepehr Valipour and Martin Jagersand and Nilanjan Ray},
  journal= {arXiv preprint arXiv:1611.05435},
  year   = {2016}
}

备注

arXiv admin note: text overlap with arXiv:1606.00487