观察世界流转:从无标签视频中进行表示学习
计算机视觉与模式识别
2020-05-08 v2
摘要
近期单图像无监督表示学习技术在多种任务上展现出显著成功。这些工作的基本原理是实例判别:学习区分同一图像的两个增强版本与一大批不相关图像。网络学习忽略增强噪声并提取语义上有意义的表示。先前工作使用人工数据增强技术如裁剪和颜色抖动,这些只能以表面方式影响图像,且与物体实际变化方式(如遮挡、形变、视角变化)不一致。在本文中,我们认为视频免费提供了这种自然增强。视频可提供物体的全新视角,展示形变,甚至连接语义相似但视觉上不同的概念。我们提出 Video Noise Contrastive Estimation(视频噪声对比估计),一种利用无标签视频学习鲁棒、可迁移的单图像表示的方法。我们在多种时间与非时间任务上展示了相对于近期无监督单图像技术以及全监督 ImageNet 预训练的改进。代码与 Random Related Video Views 数据集可在 https://www.github.com/danielgordon10/vince 获取。
引用
@article{arxiv.2003.07990,
title = {Watching the World Go By: Representation Learning from Unlabeled Videos},
author = {Daniel Gordon and Kiana Ehsani and Dieter Fox and Ali Farhadi},
journal= {arXiv preprint arXiv:2003.07990},
year = {2020}
}