基于分数匹配扩散的全带通用音频合成
声音
2022-10-27 v1 机器学习
音频与语音处理
摘要
近期的工作表明,深度生成模型能够解决基于单一标签的通用音频合成问题,产生各种脉冲、音调和环境声音。此类模型在带限信号上运行,并且作为自回归方法的结果,它们通常由预训练的潜在编码器和/或若干级联模块构成。在本工作中,我们提出了一种用于通用音频合成的基于扩散的生成模型,命名为 DAG,该模型在波形域中端到端地处理全带信号。结果表明,DAG 在质量和多样性方面均优于现有的标签条件生成器。更具体地说,与现有技术相比,DAG 的带限版本和全带版本分别实现了高达 40% 和 65% 的相对改进。我们相信 DAG 足够灵活,可以适应不同的条件模式,同时提供高质量的合成。
引用
@article{arxiv.2210.14661,
title = {Full-band General Audio Synthesis with Score-based Diffusion},
author = {Santiago Pascual and Gautam Bhattacharya and Chunghsin Yeh and Jordi Pons and Joan Serrà},
journal= {arXiv preprint arXiv:2210.14661},
year = {2022}
}