通过观看YouTube学习人体分割
计算机视觉与模式识别
2018-03-01 v2
摘要
关于人体分割的一个直觉是,当人在视频中移动时,视频上下文(如外观和运动线索)可能推断出整个人体的合理掩码信息。受此启发,基于流行的深度卷积神经网络(CNN),我们探索了一种用于人体分割任务的极弱监督学习框架,其中仅有一个不完美的人体检测器以及大量弱标记的YouTube视频可用。在我们的解决方案中,视频上下文引导的人体掩码推断与基于CNN的分割网络学习交替进行,相互增强,直到没有进一步的性能提升。在第一步中,通过无监督视频分割将每个视频分解为超体素。随后,利用来自不完美人体检测结果以及上一轮迭代训练的CNN所预测置信图的unary能量,通过图优化将超体素内的超像素分类为人体或非人体。在第二步中,将视频上下文推导出的人体掩码作为直接标签来训练CNN。在具有挑战性的PASCAL VOC 2012语义分割基准上的大量实验表明,所提框架已取得优于所有以往使用对象类别或边界框标注的弱监督方法的结果。此外,通过结合PASCAL VOC 2012的标注掩码进行扩充,我们的方法在人体分割任务上达到了新的SOTA性能。
引用
@article{arxiv.1710.01457,
title = {Learning to Segment Human by Watching YouTube},
author = {Xiaodan Liang and Yunchao Wei and Liang Lin and Yunpeng Chen and Xiaohui Shen and Jianchao Yang and Shuicheng Yan},
journal= {arXiv preprint arXiv:1710.01457},
year = {2018}
}
备注
Very-weakly supervised learning framework. New state-of-the-art performance on the human segmentation task! (Published in T-PAMI 2017)