视频中运动动力学无监督学习的对抗框架
计算机视觉与模式识别
2019-09-19 v2
摘要
视频中的人类行为理解是一个复杂且尚未解决的问题,需要在局部(像素级密集预测)和全局(运动线索聚合)两个层面上对运动进行精确建模。当前基于监督学习的方法需要大量标注数据,而标注数据的稀缺是开发通用解决方案的主要限制因素之一。无监督学习则可以利用网络上可用的大量视频,是克服现有局限性的一种有前景的解决方案。在本文中,我们提出了一个基于 GAN 的对抗框架,该框架通过自监督机制学习视频表示和动力学,以便在视频中执行密集和全局预测。我们的方法通过以下方式合成视频:1)将过程分解为静态视觉内容和运动的生成;2)学习运动潜在空间的合适表示,以强制对象轨迹的时空一致性;以及 3)将运动估计和像素级密集预测纳入训练过程。自监督是通过使用生成器在其生成过程中作为副产品产生的运动掩码来监督判别器网络执行密集预测而实现的。在标准基准上进行的性能评估表明,我们的方法能够以无监督的方式学习局部和全局视频动力学。学习到的表示随后支持了视频对象分割方法的训练,所需的标注量大幅减少(约 50%),并取得了与现有技术相当的性能。此外,所提出的方法在生成逼真视频方面取得了有前景的性能,特别是在与运动相关的指标上优于现有技术方法。
引用
@article{arxiv.1803.09092,
title = {Adversarial Framework for Unsupervised Learning of Motion Dynamics in Videos},
author = {C. Spampinato and S. Palazzo and P. D'Oro and D. Giordano and M. Shah},
journal= {arXiv preprint arXiv:1803.09092},
year = {2019}
}