用于视频对象分割的时空CNN
计算机视觉与模式识别
2019-04-05 v1
摘要
在本文中,我们提出了一个统一、端到端可训练的时空CNN模型用于视频对象分割(VOS),该模型由两支构成,即时间相干分支与空间分割分支。具体而言,时间相干分支从未标记的视频数据中以对抗方式预训练,旨在捕获视频序列的动态外观与运动线索以引导对象分割。空间分割分支专注于基于所学外观与运动线索准确分割对象。为获得准确分割结果,我们设计了一个由粗到细的过程,在多层尺度特征图上顺序应用所设计的注意力模块,并将其拼接以产生最终预测。以此方式,空间分割分支被强制逐渐集中于对象区域。这两支在视频分割序列上以端到端方式联合微调。我们在三个具有挑战性的数据集(即DAVIS-2016、DAVIS-2017和Youtube-Object)上进行了若干实验,表明我们的方法相对于当前最优方法取得了优越性能。代码见https://github.com/longyin880815/STCNN。
引用
@article{arxiv.1904.02363,
title = {Spatiotemporal CNN for Video Object Segmentation},
author = {Kai Xu and Longyin Wen and Guorong Li and Liefeng Bo and Qingming Huang},
journal= {arXiv preprint arXiv:1904.02363},
year = {2019}
}
备注
10 pages, 3 figures, 6 tables, CVPR 2019