中文

声音的力量(TPoS):基于 Stable Diffusion 的音频响应视频生成

声音 2023-09-12 v1 计算机视觉与模式识别 图形学 音频与语音处理

摘要

近年来,视频生成已成为一种重要的生成工具并引起显著关注。然而,尽管音频包含如时间语义与幅度等独特性质,音频到视频生成却很少被考虑。因此,我们提出声音的力量(TPoS)模型以纳入同时包含可变时间语义与幅度的音频输入。为生成视频帧,TPoS 利用带有文本语义信息的潜空间稳定扩散模型,随后由我们预训练的音频编码器所得的序列音频嵌入引导。结果,该方法产生音频响应视频内容。我们在多种任务上展示了 TPoS 的有效性,并将其结果与音频到视频生成领域当前最先进技术进行比较。更多示例见 https://ku-vai.github.io/TPoS/

关键词

引用

@article{arxiv.2309.04509,
  title  = {The Power of Sound (TPoS): Audio Reactive Video Generation with Stable Diffusion},
  author = {Yujin Jeong and Wonjeong Ryoo and Seunghyun Lee and Dabin Seo and Wonmin Byeon and Sangpil Kim and Jinkyu Kim},
  journal= {arXiv preprint arXiv:2309.04509},
  year   = {2023}
}

备注

ICCV2023