中文

WALDO:基于对象层分解与参数化流预测的未来视频合成

计算机视觉与模式识别 2023-08-30 v3

摘要

本文提出 WALDO(WArping Layer-Decomposed Objects),一种从过去帧预测未来视频帧的新方法。单张图像被分解为结合对象掩码与一小组控制点的多个层。层结构在每个视频的所有帧间共享以建立密集的帧间连接。复杂场景运动通过组合与各个层相关的参数化几何变换来建模,视频合成被分解为:发现与过去帧相关的层、预测对应未来帧的变换并相应扭曲相关对象区域,以及填充剩余图像部分。在包括城市场景视频(Cityscapes 与 KITTI)以及展现非刚性运动的视频(UCF-Sports 与 H3.6M)的多个基准上的大量实验表明,我们的方法在每种情况下都以显著优势持续优于当前最优方法。我们方法编写的代码、预训练模型以及合成的视频样本可在项目网页 https://16lemoing.github.io/waldo 找到。

关键词

引用

@article{arxiv.2211.14308,
  title  = {WALDO: Future Video Synthesis using Object Layer Decomposition and Parametric Flow Prediction},
  author = {Guillaume Le Moing and Jean Ponce and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2211.14308},
  year   = {2023}
}

备注

Accepted to ICCV 2023