DTVNet+:用于动态延时视频生成的高分辨率风景数据集
计算机视觉与模式识别
2021-12-20 v2
摘要
本文提出一种新颖的端到端动态延时视频生成框架,名为DTVNet,用于从单张风景图像基于归一化运动向量生成多样化的延时视频。所提出的DTVNet由两个子模块组成:\emph{光流编码器}(OFE)和\emph{动态视频生成器}(DVG)。OFE将光流图序列映射为编码生成视频运动信息的\emph{归一化运动向量}。DVG包含运动流和内容流,以从运动向量和单张风景图像中学习。此外,它包含一个编码器以学习共享内容特征,以及一个解码器以构建具有相应运动的视频帧。具体而言,\emph{运动流}引入多个\emph{自适应实例归一化}(AdaIN)层来整合多级运动信息以控制物体运动。在测试阶段,仅基于一张输入图像,通过不同的\emph{归一化运动向量}可生成具有相同内容但不同运动信息的视频。同时,我们提出了一个高分辨率风景延时视频数据集,名为Quick-Sky-Time,用于评估不同方法,其可视为高质量风景图像和视频生成任务的新基准。我们进一步在Sky Time-lapse、Beach和Quick-Sky-Time数据集上进行了实验。结果证明了我们的方法在生成高质量且多样动态视频方面优于最先进的方法。
引用
@article{arxiv.2008.04776,
title = {DTVNet+: A High-Resolution Scenic Dataset for Dynamic Time-lapse Video Generation},
author = {Jiangning Zhang and Chao Xu and Yong Liu and Yunliang Jiang},
journal= {arXiv preprint arXiv:2008.04776},
year = {2021}
}
备注
This work extends the previous DTVNet in ECCV'20, and we further present a high-quality and high-resolution Quick-Sky-Time dataset and carry out more adequate experiments and analysis