中文

使用 cINNs 的随机图像到视频合成

计算机视觉与模式识别 2021-06-18 v2

摘要

视频理解要求模型学习静态场景内容与其动态之间的特征性相互作用:给定一幅图像,模型必须能够预测所描绘场景的未来演进;反之,视频应根据其静态图像内容以及初始帧中未呈现的所有剩余特征来解释。这自然暗示了视频域与静态内容以及残差信息之间的双射映射。与常见的随机图像到视频合成不同,此类模型不仅仅生成推进初始图像的任意视频。给定该图像,它反而在残差向量与视频之间提供一一映射,并在采样时产生随机结果。该方法使用条件可逆神经网络 (cINN) 自然实现,该网络通过独立建模静态与其他视频特征来解释视频,从而为可控视频合成奠定基础。在四个不同视频数据集上的实验证明了我们的方法在合成结果的质量与多样性方面的有效性。我们的项目页面位于 https://bit.ly/3t66bnU。

关键词

引用

@article{arxiv.2105.04551,
  title  = {Stochastic Image-to-Video Synthesis using cINNs},
  author = {Michael Dorkenwald and Timo Milbich and Andreas Blattmann and Robin Rombach and Konstantinos G. Derpanis and Björn Ommer},
  journal= {arXiv preprint arXiv:2105.04551},
  year   = {2021}
}

备注

Accepted to CVPR 2021