通过姿态相似性协调实现无监督视频理解
计算机视觉与模式识别
2017-08-04 v1
摘要
理解人类活动并能详细解释它,在复杂性和价值上都远超单纯的动作分类。因此,挑战在于基于活动最基本的构成要素——个体姿态及其独特的转换——来描述活动。基于基本姿态对这种细粒度表示进行监督学习非常繁琐且难以扩展。为此,我们提出了一种完全无监督的深度学习过程,该过程仅基于视频序列,从零开始,无需预训练网络、预定义的身体模型或关键点。一种组合序列匹配算法从训练数据的子集中提出帧间关系,而一个卷积神经网络(CNN)则协调不同子集的传递性冲突,以学习一个单一的协调姿态嵌入,尽管序列间外观存在变化。在没有任何人工标注的情况下,该模型学习到了姿态及其时序发展的结构化表示。该模型不仅能检索相似姿态,还能实现时序超分辨率。此外,基于循环形式,可以合成后续帧。
引用
@article{arxiv.1708.01191,
title = {Unsupervised Video Understanding by Reconciliation of Posture Similarities},
author = {Timo Milbich and Miguel Bautista and Ekaterina Sutter and Bjorn Ommer},
journal= {arXiv preprint arXiv:1708.01191},
year = {2017}
}
备注
Accepted by ICCV 2017