中文

VIFS:一种用于 Foley 声音合成端到端变分推断方法

音频与语音处理 2023-06-09 v1 人工智能 声音

摘要

DCASE 2023 挑战赛任务 7 的目标是通过“类别到声音”的方法为 Foley 声音合成(FSS)生成各种声音片段。“类别”由单一索引表示,而对应的“声音”涵盖多样且不同的声音样本。为给定类别生成多样化声音,我们采用 VITS,一种带有变分推断的文本到语音(TTS)模型。此外,我们应用了包括 PhaseAug 和 Avocodo 在内的多种语音合成技术。与从音素和说话人身份生成短促发音的 TTS 模型不同,类别到声音问题要求仅从类别索引生成多样化声音。为弥补这一差异同时保持每个音频片段内的一致性,我们大幅修改了先验编码器以增强与后验潜变量的一致性。这在先验编码器上引入了额外的高斯分布,从而提升类别内的方差。借助这些修改,我们提出 VIFS,一种用于端到端 Foley 声音合成的变分推断方法,可生成多样的高质量声音。

关键词

引用

@article{arxiv.2306.05004,
  title  = {VIFS: An End-to-End Variational Inference for Foley Sound Synthesis},
  author = {Junhyeok Lee and Hyeonuk Nam and Yong-Hwa Park},
  journal= {arXiv preprint arXiv:2306.05004},
  year   = {2023}
}

备注

DCASE 2023 Challenge Task 7