视频到视频合成
计算机视觉与模式识别
2018-12-04 v2 图形学
机器学习
摘要
我们研究视频到视频合成问题,其目标是学习从输入源视频(例如,一系列语义分割掩码)到精确描绘源视频内容的输出逼真视频的映射函数。尽管其图像对应问题,即图像到图像合成问题,是一个热门话题,但视频到视频合成问题在文献中较少被探索。在不理解时间动态的情况下,直接将现有图像合成方法应用于输入视频通常会导致时间上不连贯且视觉质量低的视频。本文中,我们在生成对抗学习框架下提出一种新颖的视频到视频合成方法。通过精心设计的生成器和判别器架构,结合时空对抗目标,我们在包括分割掩码、草图和姿态在内的多种输入格式上实现了高分辨率、逼真、时间连贯的视频结果。在多个基准上的实验显示了我们的方法相较于强基线方法的优势。特别地,我们的模型能够合成长达30秒的2K分辨率街道场景视频,显著推进了视频合成的最先进水平。最后,我们将我们的方法应用于未来视频预测,优于多个最先进的竞争系统。
引用
@article{arxiv.1808.06601,
title = {Video-to-Video Synthesis},
author = {Ting-Chun Wang and Ming-Yu Liu and Jun-Yan Zhu and Guilin Liu and Andrew Tao and Jan Kautz and Bryan Catanzaro},
journal= {arXiv preprint arXiv:1808.06601},
year = {2018}
}
备注
In NeurIPS, 2018. Code, models, and more results are available at https://github.com/NVIDIA/vid2vid