从无标签视频的以对象为中心的表示学习
计算机视觉与模式识别
2016-12-05 v1
摘要
当前,有监督(预)训练在视觉识别的表示学习中取得最先进性能,但其代价是(1)密集的人工标注和(2)对学习相关数据范围的固有限制。本工作中,我们探索从无标签视频中进行无监督特征学习。我们提出一种新颖的以对象为中心的时间相干性方法,鼓励为从邻近帧分割出的类对象区域学习相似表示。我们的框架依赖孪生三元组网络来训练深度卷积神经网络(CNN)表示。与现有时间相干性方法相比,我们的思路优势在于对无标签视频的轻量级预处理(无需跟踪),同时仍能提取对象级区域以学习不变性。此外,正如我们在多个标准数据集上的结果所示,我们的方法在图像分类和检索任务上通常比竞争的无监督方法取得显著准确率提升。
引用
@article{arxiv.1612.00500,
title = {Object-Centric Representation Learning from Unlabeled Videos},
author = {Ruohan Gao and Dinesh Jayaraman and Kristen Grauman},
journal= {arXiv preprint arXiv:1612.00500},
year = {2016}
}
备注
In Proceedings of the Asian Conference on Computer Vision (ACCV), 2016