中文

FusionSeg:学习融合运动与表观以实现视频中通用物体的全自动分割

计算机视觉与模式识别 2017-04-13 v2

摘要

我们提出了一种端到端学习框架,用于分割视频中的通用物体。我们的方法学习结合表观与运动信息,为视频中所有显著物体生成像素级分割掩码。我们将该任务表述为结构化预测问题,并设计了一个双流全卷积神经网络,在统一框架中融合运动与表观。由于带有像素级分割的大规模视频数据集难以获取,我们展示了如何利用弱标注视频与现有图像识别数据集引导训练。通过在三个具有挑战性的视频分割基准上的实验,我们的方法在分割通用(未见过)物体方面大幅改进了当前最优水平(state-of-the-art)。代码与预训练模型已在项目网站上提供。

关键词

引用

@article{arxiv.1701.05384,
  title  = {FusionSeg: Learning to combine motion and appearance for fully automatic segmention of generic objects in videos},
  author = {Suyog Dutt Jain and Bo Xiong and Kristen Grauman},
  journal= {arXiv preprint arXiv:1701.05384},
  year   = {2017}
}

备注

CVPR 2017