WALDO:基于对象层分解与参数化流预测的未来视频合成
计算机视觉与模式识别
2023-08-30 v3
摘要
本文提出 WALDO(WArping Layer-Decomposed Objects),一种从过去帧预测未来视频帧的新方法。单张图像被分解为结合对象掩码与一小组控制点的多个层。层结构在每个视频的所有帧间共享以建立密集的帧间连接。复杂场景运动通过组合与各个层相关的参数化几何变换来建模,视频合成被分解为:发现与过去帧相关的层、预测对应未来帧的变换并相应扭曲相关对象区域,以及填充剩余图像部分。在包括城市场景视频(Cityscapes 与 KITTI)以及展现非刚性运动的视频(UCF-Sports 与 H3.6M)的多个基准上的大量实验表明,我们的方法在每种情况下都以显著优势持续优于当前最优方法。我们方法编写的代码、预训练模型以及合成的视频样本可在项目网页 https://16lemoing.github.io/waldo 找到。
引用
@article{arxiv.2211.14308,
title = {WALDO: Future Video Synthesis using Object Layer Decomposition and Parametric Flow Prediction},
author = {Guillaume Le Moing and Jean Ponce and Cordelia Schmid},
journal= {arXiv preprint arXiv:2211.14308},
year = {2023}
}
备注
Accepted to ICCV 2023