视频诱导视觉不变性的自监督学习
计算机视觉与模式识别
2020-04-03 v2 机器学习
摘要
我们提出一种基于视频诱导视觉不变性(VIVI)的通用自监督学习框架,用于学习可迁移的视觉表示。我们考虑视频中隐含的层次结构,并利用(i)帧级不变性(如对颜色和对比度扰动的稳定性),(ii)镜头/片段级不变性(如对物体朝向和光照条件变化的鲁棒性),以及(iii)视频级不变性(跨镜头/片段的场景语义关系)来定义整体的自监督损失。使用所提框架的不同变体在 YouTube-8M(YT8M)数据集的视频上训练模型,我们在 Visual Task Adaptation Benchmark(VTAB)的19个多样化下游任务上取得了最先进的自监督迁移学习效果,每个任务仅使用1000个标签。随后我们展示了如何将我们的模型与有标签图像联合训练,以少10倍的有标签图像超越 ImageNet 预训练的 ResNet-50 达0.8个百分点,并使用完整 ImageNet 数据集比先前最佳监督模型高出3.7个百分点。
引用
@article{arxiv.1912.02783,
title = {Self-Supervised Learning of Video-Induced Visual Invariances},
author = {Michael Tschannen and Josip Djolonga and Marvin Ritter and Aravindh Mahendran and Xiaohua Zhai and Neil Houlsby and Sylvain Gelly and Mario Lucic},
journal= {arXiv preprint arXiv:1912.02783},
year = {2020}
}
备注
CVPR 2020