由单张语义标签图生成视频
计算机视觉与模式识别
2019-03-12 v1
摘要
本文提出了以单张语义标签图为条件的视频生成新任务,该任务在生成过程的灵活性与质量之间提供了良好平衡。与典型的端到端方法(在单步中同时建模场景内容与动态)不同,我们提出将该困难任务分解为两个子问题。由于当前图像生成方法在细节上优于视频生成,我们仅通过生成第一帧来合成高质量内容。然后我们基于其语义含义对场景进行动画处理以获得时间一致的视频,从而总体上给出优异结果。我们采用 cVAE 预测光流,作为生成以初始单帧为条件的视频序列的有益中间步骤。语义标签图被整合进光流预测模块,以在图像到视频生成过程中实现重大改进。在 Cityscapes 数据集上的大量实验表明,我们的方法优于所有对比方法。
引用
@article{arxiv.1903.04480,
title = {Video Generation from Single Semantic Label Map},
author = {Junting Pan and Chengyu Wang and Xu Jia and Jing Shao and Lu Sheng and Junjie Yan and Xiaogang Wang},
journal= {arXiv preprint arXiv:1903.04480},
year = {2019}
}
备注
Paper accepted at CVPR 2019. Source code and models available at https://github.com/junting/seg2vid/tree/master