声音引导的语义视频生成
计算机视觉与模式识别
2022-10-24 v4 人工智能
摘要
StyleGAN近期的成功表明,预训练的StyleGAN潜空间对真实感视频生成很有用。然而,由于难以确定StyleGAN潜空间中的方向与幅度,生成的视频运动通常不具有语义意义。本文提出一种利用多模态(声音-图像-文本)嵌入空间生成真实感视频的框架。由于声音提供了场景的时间上下文,我们的框架学习生成与声音语义一致的视频。首先,我们的声音反演模块将音频直接映射到StyleGAN潜空间。我们随后引入基于CLIP的多模态嵌入空间以进一步提供视听关系。最后,所提出的帧生成器学习在潜空间中寻找与对应声音相一致的轨迹,并以分层方式生成视频。我们提供了用于声音引导视频生成任务的新的高分辨率风景视频数据集(视听对)。实验表明,我们的模型在视频质量上优于最先进的方法。我们进一步展示了包括图像与视频编辑在内的若干应用,以验证方法的有效性。
引用
@article{arxiv.2204.09273,
title = {Sound-Guided Semantic Video Generation},
author = {Seung Hyun Lee and Gyeongrok Oh and Wonmin Byeon and Chanyoung Kim and Won Jeong Ryoo and Sang Ho Yoon and Hyunjun Cho and Jihyun Bae and Jinkyu Kim and Sangpil Kim},
journal= {arXiv preprint arXiv:2204.09273},
year = {2022}
}