世界一致性的视频到视频合成
计算机视觉与模式识别
2020-07-17 v1
摘要
视频到视频合成(vid2vid)旨在将高层语义输入转换为照片真实感视频。尽管现有 vid2vid 方法能实现短期时间一致性,却无法确保长期一致性。这是因为它们缺乏对被渲染的 3D 世界的认知,且仅基于过去若干帧生成每一帧。为克服该局限,我们引入一种新颖的 vid2vid 框架,在渲染过程中高效且有效地利用所有过去生成的帧。这通过将迄今渲染的 3D 世界浓缩为对当前帧的基于物理的估计(我们称之为引导图像)来实现。我们进一步提出一种新颖的神经网络架构,以利用存储于引导图像中的信息。在多个具挑战性数据集上的大量实验结果验证了我们的方法在实现世界一致性(输出视频在整个被渲染的 3D 世界内一致)方面的有效性。https://nvlabs.github.io/wc-vid2vid/
引用
@article{arxiv.2007.08509,
title = {World-Consistent Video-to-Video Synthesis},
author = {Arun Mallya and Ting-Chun Wang and Karan Sapra and Ming-Yu Liu},
journal= {arXiv preprint arXiv:2007.08509},
year = {2020}
}
备注
Published at the European Conference on Computer Vision, 2020