声音的力量(TPoS):基于 Stable Diffusion 的音频响应视频生成
声音
2023-09-12 v1 计算机视觉与模式识别
图形学
音频与语音处理
摘要
近年来,视频生成已成为一种重要的生成工具并引起显著关注。然而,尽管音频包含如时间语义与幅度等独特性质,音频到视频生成却很少被考虑。因此,我们提出声音的力量(TPoS)模型以纳入同时包含可变时间语义与幅度的音频输入。为生成视频帧,TPoS 利用带有文本语义信息的潜空间稳定扩散模型,随后由我们预训练的音频编码器所得的序列音频嵌入引导。结果,该方法产生音频响应视频内容。我们在多种任务上展示了 TPoS 的有效性,并将其结果与音频到视频生成领域当前最先进技术进行比较。更多示例见 https://ku-vai.github.io/TPoS/
引用
@article{arxiv.2309.04509,
title = {The Power of Sound (TPoS): Audio Reactive Video Generation with Stable Diffusion},
author = {Yujin Jeong and Wonjeong Ryoo and Seunghyun Lee and Dabin Seo and Wonmin Byeon and Sangpil Kim and Jinkyu Kim},
journal= {arXiv preprint arXiv:2309.04509},
year = {2023}
}
备注
ICCV2023