草图生成视频:基于两幅粗糙草图的人像视频合成
计算机视觉与模式识别
2021-10-12 v1
摘要
视频创作对艺术家而言一直是一项引人入胜却充满挑战的任务。随着深度学习的发展,近期工作尝试利用深度卷积神经网络在引导视频的辅助下合成视频,并取得了有前景的结果。然而,引导视频或其他形式引导时序信息的获取在现实中成本高昂且困难。因此,本工作中我们引入一种新的视频合成任务,仅以两幅粗糙的劣质手绘草图作为输入来创建逼真的人像视频。我们提出了一种两阶段草图到视频(Sketch-to-Video)模型,包含两个关键创新:1)特征检索与投影(FRP)模块,将输入草图划分为不同部分,并利用这些部分合成逼真的起始或结束帧,同时生成丰富的语义特征,旨在缓解因不同用户任意绘制的自由形式草图风格所导致的草图域外问题。2)运动投影后接特征混合模块,将一段视频(仅用于训练阶段)投影到由正态分布建模的运动空间中,并将运动变量与上述提取的语义特征相混合,旨在缓解测试阶段引导时序信息缺失的问题。在CelebAMask-HQ与VoxCeleb2数据集组合上的实验充分验证,我们的方法能够从两幅粗糙劣质草图合成高质量视频,并取得良好的定量与定性结果。
引用
@article{arxiv.2110.04710,
title = {Sketch Me A Video},
author = {Haichao Zhang and Gang Yu and Tao Chen and Guozhong Luo},
journal= {arXiv preprint arXiv:2110.04710},
year = {2021}
}