利用深度神经嵌入从视频进行无监督学习
计算机视觉与模式识别
2020-03-12 v2 人工智能
机器学习
摘要
由于视频具有丰富的动态结构且在日常生活中无处不在,将视频数据作为训练深度神经网络视觉表征的强大无监督学习信号是一个自然的想法。然而,将这一想法付诸实现,尤其是在大规模下实现,一直是一项重大的人工智能挑战。在此,我们提出视频实例嵌入(VIE)框架,该框架将近期强大的用于学习深度非线性嵌入的无监督损失函数扩展至大规模视频数据集上的多流时间处理架构。我们表明,经 VIE 训练的网络在从视频数据流进行无监督学习方面大幅提升了现有技术水平,这在 Kinetics 数据集的动作识别和 ImageNet 数据集的物体识别中均得到了验证。我们表明,兼具静态和动态处理通路的混合模型对这两个迁移任务均为最优的,并提供了表明通路差异的分析。结合上下文来看,我们的结果表明深度神经嵌入是一种在各种领域进行无监督视觉学习的极具前景的方法。
引用
@article{arxiv.1905.11954,
title = {Unsupervised Learning from Video with Deep Neural Embeddings},
author = {Chengxu Zhuang and Tianwei She and Alex Andonian and Max Sobol Mark and Daniel Yamins},
journal= {arXiv preprint arXiv:1905.11954},
year = {2020}
}
备注
To appear in CVPR 2020