中文

无时序信息的视频目标分割

计算机视觉与模式识别 2018-05-17 v2

摘要

视频目标分割以及一般的视频处理,历来由依赖连续视频帧中时间一致性和冗余的方法所主导。当时间平滑性被突然打破时,例如当目标被遮挡或序列中缺失某些帧时,这些方法的结果可能会显著恶化,甚至可能根本无法产生任何结果。本文探索了独立处理每一帧的正交方法,即忽略时序信息。具体而言,它处理半监督视频目标分割的任务:在给定第一帧掩码的情况下,将视频中的目标从背景中分离出来。我们提出了语义单样本视频目标分割(OSVOS-S),基于一个全卷积神经网络架构,该架构能够将 ImageNet 上学习到的通用语义信息连续转移到前景分割任务中,并最终学习测试序列中单个标注目标的外观(因此是单样本)。我们表明,实例级语义信息如果有效结合,可以显著改善我们先前方法 OSVOS 的结果。我们在两个最近的视频分割数据库上进行了实验,结果表明 OSVOS-S 是 SOTA 中最快且最准确的方法。

关键词

引用

@article{arxiv.1709.06031,
  title  = {Video Object Segmentation Without Temporal Information},
  author = {Kevis-Kokitsi Maninis and Sergi Caelles and Yuhua Chen and Jordi Pont-Tuset and Laura Leal-Taixé and Daniel Cremers and Luc Van Gool},
  journal= {arXiv preprint arXiv:1709.06031},
  year   = {2018}
}

备注

Accepted to T-PAMI. Extended version of "One-Shot Video Object Segmentation", CVPR 2017 (arXiv:1611.05198). Project page: http://www.vision.ee.ethz.ch/~cvlsegmentation/osvos/