中文

驯服视觉引导的声音生成

计算机视觉与模式识别 2021-10-19 v1 人工智能 机器学习 声音 音频与语音处理

摘要

近期在视觉诱导音频生成方面的进展基于采样短时长、低保真且单一类别的声音。此外,在最先进模型上采样 1 秒音频在高端 GPU 上需要数分钟。在本工作中,我们提出了一个单一模型,能够在单个 GPU 上以少于播放所需时间生成与开放域视频的一组帧相关的、高保真的声音。我们训练一个 transformer,在给定视频特征集合的条件下从预训练的谱图 codebook 中采样新的谱图。该 codebook 使用 VQGAN 的一种变体获得,该变体经过训练以产生具有基于谱图的感知损失的紧凑采样空间。生成的谱图使用基于窗口的 GAN 转换为波形,显著加快了生成速度。考虑到缺乏用于自动评估生成谱图的指标,我们还构建了一系列称为 FID 和 MKL 的指标。这些指标基于一种称为 Melception 的新型声音分类器,旨在评估开放域样本的保真度与相关度。我们在小规模和大规模数据集上进行了定性与定量研究,以评估生成样本的保真度与相关度。我们还将我们的模型与最先进模型进行比较,观察到在质量、规模和计算时间上的显著改进。代码、演示和样本:v-iashin.github.io/SpecVQGAN

关键词

引用

@article{arxiv.2110.08791,
  title  = {Taming Visually Guided Sound Generation},
  author = {Vladimir Iashin and Esa Rahtu},
  journal= {arXiv preprint arXiv:2110.08791},
  year   = {2021}
}

备注

Accepted as an oral presentation for the BMVC 2021. Code: https://github.com/v-iashin/SpecVQGAN Project page: https://v-iashin.github.io/SpecVQGAN