分层可控视频生成
计算机视觉与模式识别
2022-10-05 v3
摘要
我们引入了分层可控视频生成,该方法无需任何监督即可将视频的初始帧分解为前景层和背景层,用户只需操作前景掩码即可控制视频生成过程。关键挑战在于无监督的前景-背景分离(这本身具有模糊性),以及在仅能访问原始视频序列的情况下预测用户操作的能力。我们通过提出一个两阶段学习过程来应对这些挑战。在第一阶段,利用丰富的损失函数集和动态前景尺寸先验,我们学习如何将帧分离为前景层和背景层,并以这些层为条件,使用 VQ-VAE 生成器生成下一帧。在第二阶段,我们通过拟合来自未来帧的掩码的(参数化)控制,对该网络进行微调以预测对掩码的编辑。我们展示了这种学习方法和更精细控制机制的有效性,同时在两个基准数据集上展现了最先进的性能。我们在 https://gabriel-huang.github.io/layered_controllable_video_generation 上提供了视频摘要以及一些视频结果。
引用
@article{arxiv.2111.12747,
title = {Layered Controllable Video Generation},
author = {Jiahui Huang and Yuhe Jin and Kwang Moo Yi and Leonid Sigal},
journal= {arXiv preprint arXiv:2111.12747},
year = {2022}
}
备注
This paper has been accepted to ECCV 2022 as an Oral paper