来自视频的真值标签传播能否辅助语义分割?
计算机视觉与模式识别
2016-10-05 v1
摘要
对于最先进的语义分割任务,训练卷积神经网络(CNN)需要密集的逐像素真值(GT)标注,这既昂贵又需要大量人工投入。在本工作中,我们研究了利用辅助真值——即所谓的伪真值(PGT)——来提升性能的可能性。PGT是通过使用基于简单CRF的线索整合框架,将GT帧的标签传播到视频后续帧而获得的。我们的主要贡献在于证明可以将含噪声的PGT与GT结合使用来提升CNN的性能。我们进行了系统性分析,以找出训练CNN时需要与GT一起添加的合适类型的PGT。在这方面,我们探讨了PGT影响CNN学习的三个方面:i)PGT标注的质量要好;ii)PGT图像应与GT图像不同;iii)PGT的信任度应与GT不同。我们得出结论:与GT图像具有差异性且标注质量良好的PGT确实能够提升CNN的性能。此外,当PGT的数量是GT的多倍时,降低对PGT的信任度有助于提升准确率。最后,我们证明将PGT与GT结合使用后,FCN在Camvid数据集上的IoU准确率提升了2.7%。我们认为这种方法可用于训练用于语义视频分割的CNN,在这种情况下需要序列标注的图像帧。为此,我们提供了关于策略性使用PGT进行语义分割的建议,从而绕过大量人工标注的需求。
引用
@article{arxiv.1610.00731,
title = {Can Ground Truth Label Propagation from Video help Semantic Segmentation?},
author = {Siva Karthik Mustikovela and Michael Ying Yang and Carsten Rother},
journal= {arXiv preprint arXiv:1610.00731},
year = {2016}
}
备注
To appear at ECCV 2016 Workshop on Video Segmentation