SSGVS:语义场景图到视频合成
计算机视觉与模式识别
2022-11-18 v2
摘要
作为图像合成任务的自然延伸,视频合成近来引起了广泛关注。许多图像合成工作利用类别标签或文本作为引导。然而,标签和文本均无法提供明确的时间引导,例如某个动作何时开始或结束。为克服这一局限,我们引入语义视频场景图作为视频合成的输入,因为它们表示了场景中物体之间的空间与时间关系。由于视频场景图通常是时间离散的标注,我们提出了一种视频场景图(VSG)编码器,其不仅编码已有的视频场景图,还预测未标注帧的图表示。该 VSG 编码器通过不同的对比多模态损失进行预训练。基于预训练的 VSG 编码器、VQ-VAE 和自回归 Transformer,我们提出了一种语义场景图到视频合成框架(SSGVS),用于在给定初始场景图像和数量不定的语义场景图的情况下合成视频。我们在 Action Genome 数据集上评估了 SSGVS 及其他最先进的视频合成模型,并证明了视频场景图在视频合成中的积极意义。源代码将公开发布。
引用
@article{arxiv.2211.06119,
title = {SSGVS: Semantic Scene Graph-to-Video Synthesis},
author = {Yuren Cong and Jinhui Yi and Bodo Rosenhahn and Michael Ying Yang},
journal= {arXiv preprint arXiv:2211.06119},
year = {2022}
}