基于门控循环流传播的语义视频分割
计算机视觉与模式识别
2017-10-03 v2
摘要
语义视频分割具有挑战性,因为构建精确模型需要处理和标注海量数据。在本文中,我们提出了一种深层的、端到端可训练的视频分割方法,能够利用未标注数据中的信息来改善语义估计。我们的模型结合了卷积架构和时空 Transformer 循环层,能够通过光流在时间上传播标注信息,并基于局部估计的不确定性进行自适应门控。流模块、识别模块和门控时间传播模块可以进行端到端联合训练。我们模型中的时间门控循环流传播组件可以插入任何静态语义分割架构中,将其转换为弱监督视频处理架构。我们在具有挑战性的 CityScapes 和 CamVid 数据集上基于多种深度架构进行了大量实验,结果表明,所得模型能够利用已标注帧旁边的未标注时间帧来提高视频分割精度及其时间标注的一致性,且无需额外的标注成本和极少的额外计算。
引用
@article{arxiv.1612.08871,
title = {Semantic Video Segmentation by Gated Recurrent Flow Propagation},
author = {David Nilsson and Cristian Sminchisescu},
journal= {arXiv preprint arXiv:1612.08871},
year = {2017}
}
备注
The experiments section is extended compared to the previous version