解耦传播与生成以实现视频预测
计算机视觉与模式识别
2019-08-06 v2
摘要
动态场景包含两类元素:一类流畅运动并可从前序帧预测,另一类被暴露(解除遮挡)且无法外推。先前的视频预测方法通常学习扭曲或幻构未来像素之一,而非两者兼顾。本文描述一种用于高保真视频预测的计算模型,该模型将运动特定的传播与运动无关的生成解耦。我们引入一种置信度感知的扭曲算子,其对来自流预测器的非遮挡区域像素预测与来自上下文编码器的遮挡区域像素预测进行门控输出。此外,不同于先前工作中置信度与流和外观通过单一网络联合学习,我们在扭曲步骤后计算置信度,并采用独立网络对暴露区域进行修补。在合成与真实数据集上的实证结果表明,相较于强基线,我们的解耦方法提供了更好的遮挡图,并生成更清晰且更真实的预测。
引用
@article{arxiv.1812.00452,
title = {Disentangling Propagation and Generation for Video Prediction},
author = {Hang Gao and Huazhe Xu and Qi-Zhi Cai and Ruth Wang and Fisher Yu and Trevor Darrell},
journal= {arXiv preprint arXiv:1812.00452},
year = {2019}
}
备注
ICCV 2019