中文

通过文本到视频模型适配实现多样且对齐的音频到视频生成

机器学习 2023-09-29 v1 人工智能

摘要

我们考虑由来自广泛语义类别的自然音频样本引导生成多样且真实视频的任务。对于该任务,视频要求与输入音频在全局和时序上均对齐:全局上,输入音频与整个输出视频语义相关;时序上,输入音频的每一段与该视频的对应段相关联。我们利用现有的文本条件视频生成模型与预训练的音频编码器模型。所提方法基于一个轻量级适配器网络,其学习将基于音频的表示映射到文本到视频生成模型所期望的输入表示。因此,它也支持以文本、音频以及(据我们所知首次)文本与音频同时进行条件化的视频生成。我们在三个数据集上广泛验证了我们的方法,展示了音频-视频样本显著的语义多样性,并进一步提出了一种新颖的评估指标(AV-Align)来评估生成视频与输入音频样本的对齐程度。AV-Align基于两种模态中能量峰的检测与比较。与近期最先进方法相比,我们的方法生成的视频在内容和时间轴上均与输入声音对齐得更好。我们还表明,我们的方法产生的视频具有更高的视觉质量且更加多样。

关键词

引用

@article{arxiv.2309.16429,
  title  = {Diverse and Aligned Audio-to-Video Generation via Text-to-Video Model Adaptation},
  author = {Guy Yariv and Itai Gat and Sagie Benaim and Lior Wolf and Idan Schwartz and Yossi Adi},
  journal= {arXiv preprint arXiv:2309.16429},
  year   = {2023}
}

备注

9 pages, 6 figures