基于视频的视觉表征无监督学习
计算机视觉与模式识别
2015-10-07 v2
摘要
学习良好的视觉表征是否需要强监督?我们是否真的需要数百万张语义标注图像来训练卷积神经网络(CNN)?本文中,我们提出一种简单却出乎意料强大的CNN无监督学习方法。具体而言,我们利用来自网络的数十万段无标签视频来学习视觉表征。我们的核心思想是视觉跟踪提供监督信号。即,由一条跟踪轨迹连接的两个图像块在深度特征空间中应具有相似的视觉表征,因为它们可能属于同一物体或物体部件。我们设计了一个带有排序损失函数的连体三元组网络(Siamese-triplet network)来训练该CNN表征。在不使用ImageNet中单张图像、仅使用100K无标签视频和VOC 2012数据集的情况下,我们训练了一组无监督网络集成,取得了52%的mAP(无边界框回归)。该性能与其ImageNet监督对应的集成(达到54.4% mAP)极为接近。我们还展示了我们的无监督网络在其他任务(如表面法线估计)中具有竞争力。
引用
@article{arxiv.1505.00687,
title = {Unsupervised Learning of Visual Representations using Videos},
author = {Xiaolong Wang and Abhinav Gupta},
journal= {arXiv preprint arXiv:1505.00687},
year = {2015}
}