中文

MRF 中的 CNN:基于 CNN 的高阶时空 MRF 推断的视频目标分割

计算机视觉与模式识别 2018-03-28 v1

摘要

本文解决了视频目标分割问题,其中初始目标掩码在输入视频的第一帧中给出。我们提出了一种在像素上定义的新型时空马尔可夫随机场(MRF)模型来处理这一问题。与传统的 MRF 模型不同,我们模型中像素间的空间依赖性由卷积神经网络(CNN)编码。具体而言,对于给定目标,一组空间相邻像素的标记概率可以由为该特定目标训练的 CNN 预测。因此,该集合中像素间的高阶、更丰富的依赖性可以由 CNN 隐式建模。在通过光流建立时间依赖性后,由此产生的 MRF 模型结合了空间和时间线索以解决视频目标分割。然而,由于非常高阶的依赖性,在 MRF 模型中进行推断非常困难。为此,我们提出了一种嵌入 CNN 的算法在 MRF 中进行近似推断。该算法通过在时间融合步骤和前馈 CNN 步骤之间交替进行。当使用基于外观的单样本分割 CNN 进行初始化时,我们的模型优于 DAVIS 2017 Challenge 的获胜作品,而无需诉诸模型集成或任何专用检测器。

关键词

引用

@article{arxiv.1803.09453,
  title  = {CNN in MRF: Video Object Segmentation via Inference in A CNN-Based Higher-Order Spatio-Temporal MRF},
  author = {Linchao Bao and Baoyuan Wu and Wei Liu},
  journal= {arXiv preprint arXiv:1803.09453},
  year   = {2018}
}

备注

CVPR 2018