中文

基于分数匹配扩散的全带通用音频合成

声音 2022-10-27 v1 机器学习 音频与语音处理

摘要

近期的工作表明,深度生成模型能够解决基于单一标签的通用音频合成问题,产生各种脉冲、音调和环境声音。此类模型在带限信号上运行,并且作为自回归方法的结果,它们通常由预训练的潜在编码器和/或若干级联模块构成。在本工作中,我们提出了一种用于通用音频合成的基于扩散的生成模型,命名为 DAG,该模型在波形域中端到端地处理全带信号。结果表明,DAG 在质量和多样性方面均优于现有的标签条件生成器。更具体地说,与现有技术相比,DAG 的带限版本和全带版本分别实现了高达 40% 和 65% 的相对改进。我们相信 DAG 足够灵活,可以适应不同的条件模式,同时提供高质量的合成。

关键词

引用

@article{arxiv.2210.14661,
  title  = {Full-band General Audio Synthesis with Score-based Diffusion},
  author = {Santiago Pascual and Gautam Bhattacharya and Chunghsin Yeh and Jordi Pons and Joan Serrà},
  journal= {arXiv preprint arXiv:2210.14661},
  year   = {2022}
}