基于无监督地标的视频插值与预测
计算机视觉与模式识别
2019-09-09 v1 机器学习
机器学习
摘要
长程视频数据的预测和插值涉及对每个可见物体的运动轨迹、遮挡与重现以及因视角和光照引起的表观变化进行建模的复杂任务。基于光流的技术具有泛化性,但仅适用于短时间范围。许多方法选择将视频帧投影到低维潜在空间,从而实现长程预测。然而,这些潜在表示通常不可解释,因此难以操控。本工作将视频预测和插值视为无监督潜在结构推断,随后在此潜在空间中进行时间预测。潜在表示在没有关键点或姿态等显式监督的情况下捕获前景语义。此外,由于每个地标可以映射到一个指示语义部分位置的坐标,我们可以在坐标域内可靠地进行插值,以实现可预测的运动插值。给定一个能够将这些地标映射回图像域的图像解码器,我们能够通过在地标表示空间上操作来实现高质量的长程视频插值和外推。
引用
@article{arxiv.1909.02749,
title = {Video Interpolation and Prediction with Unsupervised Landmarks},
author = {Kevin J. Shih and Aysegul Dundar and Animesh Garg and Robert Pottorf and Andrew Tao and Bryan Catanzaro},
journal= {arXiv preprint arXiv:1909.02749},
year = {2019}
}
备注
Technical Report