学习语义感知动态以实现视频预测
计算机视觉与模式识别
2021-04-21 v1
摘要
我们提出一种架构与训练方案,通过显式建模去遮挡并捕捉视频中语义一致区域的演化来预测视频帧。场景布局(语义图)与运动(光流)被分解为多个图层,这些图层被预测并与上下文融合以生成未来的布局与运动。场景外观利用预测运动在共可见区域从过去帧扭曲得到;去遮挡区域利用预测的场景布局通过内容感知修复进行合成。结果是一个显式表示对象并学习其类别特定运动的预测模型,我们在视频预测基准上对其进行了评估。
引用
@article{arxiv.2104.09762,
title = {Learning Semantic-Aware Dynamics for Video Prediction},
author = {Xinzhu Bei and Yanchao Yang and Stefano Soatto},
journal= {arXiv preprint arXiv:2104.09762},
year = {2021}
}
备注
Paper accepted at CVPR 2021