FusionSeg:学习融合运动与表观以实现视频中通用物体的全自动分割
计算机视觉与模式识别
2017-04-13 v2
摘要
我们提出了一种端到端学习框架,用于分割视频中的通用物体。我们的方法学习结合表观与运动信息,为视频中所有显著物体生成像素级分割掩码。我们将该任务表述为结构化预测问题,并设计了一个双流全卷积神经网络,在统一框架中融合运动与表观。由于带有像素级分割的大规模视频数据集难以获取,我们展示了如何利用弱标注视频与现有图像识别数据集引导训练。通过在三个具有挑战性的视频分割基准上的实验,我们的方法在分割通用(未见过)物体方面大幅改进了当前最优水平(state-of-the-art)。代码与预训练模型已在项目网站上提供。
引用
@article{arxiv.1701.05384,
title = {FusionSeg: Learning to combine motion and appearance for fully automatic segmention of generic objects in videos},
author = {Suyog Dutt Jain and Bo Xiong and Kristen Grauman},
journal= {arXiv preprint arXiv:1701.05384},
year = {2017}
}
备注
CVPR 2017