利用时序相干深度网络从视频中进行无监督学习
计算机视觉与模式识别
2018-10-12 v2
摘要
在这项工作中,我们解决了从视频中进行无监督学习的挑战性问题。现有方法利用连续视频帧中的时空连续性作为学习过程的正则化。通常,这种邻近帧的时序相干性被用作一种自由形式的标注,鼓励所学表征在这些帧之间表现出微小差异。但这类方法未能捕捉不同内容视频之间的差异性,从而学到判别性较弱的特征。我们在此提出两种用于卷积神经网络(CNN)的孪生架构及其对应的新颖损失函数,从未标注视频中学习,联合利用连续帧之间的局部时序相干性,以及用于分离不同视频表征的全局判别间隔。我们给出了广泛的实验评估,在各种任务上验证了所提模型。首先,我们展示了所学特征如何用于发现视频集合中的动作与场景。其次,我们展示了仅从未标注视频进行此类无监督学习的好处,其可直接用作图像中动作与物体监督识别任务的先验,我们的结果进一步表明我们的特征甚至能超越传统的重度监督预训练加微调策略。
引用
@article{arxiv.1801.08100,
title = {Unsupervised learning from videos using temporal coherency deep networks},
author = {Carolina Redondo-Cabrera and Roberto J. López-Sastre},
journal= {arXiv preprint arXiv:1801.08100},
year = {2018}
}