中文

VarietySound:基于无监督信息解耦的音色可控视频到声音生成

多媒体 2022-11-22 v1 计算机视觉与模式识别 声音 音频与语音处理

摘要

视频到声音生成旨在给定视频输入时生成真实自然的声音。然而,以往的视频到声音生成方法只能生成随机或平均的音色,而无法对生成声音的 timbre(音色)进行任何控制或特化,导致人们有时无法在这些方法下获得所需音色。本文提出给定视频输入与参考音频样本生成具有特定音色的声音这一任务。为解决该任务,我们将每个目标声音音频解耦为三个成分:时间信息、声学信息与背景信息。我们首先使用三个编码器分别编码这些成分:1)时间编码器编码时间信息,其以视频帧为输入,因输入视频与原始音频共享相同时间信息;2)声学编码器编码音色信息,其以原始音频为输入并通过时间破坏操作丢弃其时间信息;3)背景编码器编码残差或背景声音,其以原始音频的背景部分作为输入。为使生成结果获得更好质量与时间对齐,我们还采用 mel 判别器与时间判别器进行对抗训练。我们在 VAS 数据集上的实验结果表明,我们的方法能生成高质量音频样本,其与视频中事件良好同步且与参考音频具有高音色相似度。

关键词

引用

@article{arxiv.2211.10666,
  title  = {VarietySound: Timbre-Controllable Video to Sound Generation via Unsupervised Information Disentanglement},
  author = {Chenye Cui and Yi Ren and Jinglin Liu and Rongjie Huang and Zhou Zhao},
  journal= {arXiv preprint arXiv:2211.10666},
  year   = {2022}
}