解耦视频中的运动、前景与背景特征
计算机视觉与模式识别
2017-07-18 v2 人工智能
多媒体
摘要
本文提出一种无监督框架,用于提取语义丰富的特征以进行视频表示。受人类视觉系统基于运动线索对物体进行分组的启发,我们提出了一种深度卷积神经网络,用于解耦运动、前景和背景信息。所提出的架构包含一个针对16帧块的3D卷积特征编码器,该编码器通过对序列的首帧和末帧进行重建任务来训练。我们进行了一项初步的有监督实验,通过使用UCF-101数据集中的部分视频训练模型,并以活动区域周围的边界框作为真值,来验证所提方法的可行性。定性结果表明,该网络能够成功分割视频中的前景和背景,并基于解耦的运动特征更新前景外观。这些学习到的特征的优势在一项判别分类任务中得到展示:使用所提出的预训练方法初始化网络优于随机初始化和自编码器预训练。我们的模型和源代码公开于 https://imatge-upc.github.io/unsupervised-2017-cvprw/ 。
引用
@article{arxiv.1707.04092,
title = {Disentangling Motion, Foreground and Background Features in Videos},
author = {Xunyu Lin and Victor Campos and Xavier Giro-i-Nieto and Jordi Torres and Cristian Canton Ferrer},
journal= {arXiv preprint arXiv:1707.04092},
year = {2017}
}
备注
Poster presented at the CVPR 2017 Workshop Brave New Ideas for Motion Representations in Videos