面向语义分割的多视角交叉监督
计算机视觉与模式识别
2018-12-06 v1
摘要
本文提出了一种利用多视角图像流进行定制化语义分割任务的半监督学习框架。该定制化任务的一个关键挑战在于,由于需要耗费大量人工标注精力,标注数据的获取十分有限。我们假设可以利用通过底层三维几何关联起来的多视角图像流,其为训练分割模型提供额外的监督信号。我们提出了一种基于形状信念传递的新交叉监督方法——类比于由轮廓重建形状(shape-from-silhouette),利用一幅图像中的分割信念通过极几何预测另一幅图像的分割信念。该形状信念传递为无标注数据提供了分割的上界与下界,且随着标注视角数量的增加,其间隙渐近趋于零。我们将该理论集成以设计一种对相机标定、网络模型和语义类别均不敏感、并绕过次优三维重建中间过程的新颖网络。我们通过从真实世界视觉数据(包括非人类物种以及社交视频中难以获取大规模标注数据的感兴趣主体)中逐像素识别定制化语义类别来验证该网络。
引用
@article{arxiv.1812.01738,
title = {Multiview Cross-supervision for Semantic Segmentation},
author = {Yuan Yao and Hyun Soo Park},
journal= {arXiv preprint arXiv:1812.01738},
year = {2018}
}