少样本视频到视频合成
计算机视觉与模式识别
2019-10-29 v1 图形学
机器学习
摘要
视频到视频合成(vid2vid)旨在将输入语义视频(如人体姿态或分割掩码视频)转换为输出的照片级真实感视频。尽管 vid2vid 的最先进技术已显著进步,现有方法存在两个主要局限。首先,它们数据需求量大,需要大量目标人物或场景的图像用于训练。其次,已学习模型的泛化能力有限:一个姿态到人体的 vid2vid 模型只能合成训练集中单个人的姿态,无法泛化到训练集之外的其他人。为克服这些局限,我们提出了一种少样本 vid2vid 框架,其在测试时利用目标的少量示例图像,学习合成先前未见过的主体或场景的视频。我们的模型通过一种利用注意力机制的新型网络权重生成模块实现了该少样本泛化能力。我们使用包括人体舞蹈视频、说话头部视频和街景视频在内的多个大规模视频数据集,与强基线进行了广泛的实验验证与比较。实验结果证实了所提框架在解决现有 vid2vid 方法两个局限方面的有效性。
引用
@article{arxiv.1910.12713,
title = {Few-shot Video-to-Video Synthesis},
author = {Ting-Chun Wang and Ming-Yu Liu and Andrew Tao and Guilin Liu and Jan Kautz and Bryan Catanzaro},
journal= {arXiv preprint arXiv:1910.12713},
year = {2019}
}
备注
In NeurIPS, 2019