中文

音频扩散模型综述:生成式AI中的语音合成与增强

声音 2023-04-04 v2 人工智能 机器学习 多媒体 音频与语音处理

摘要

生成式AI已在多个领域展现出令人印象深刻的性能,其中语音合成是一个有趣的方向。随着扩散模型成为最流行的生成模型,大量工作尝试了两个活跃任务:文本到语音和语音增强。本工作对音频扩散模型进行了综述,补充了现有综述的不足——后者要么缺乏基于扩散的语音合成的最新进展,要么强调扩散模型在多领域应用的整体图景。具体而言,本工作首先简要介绍音频与扩散模型的背景。对于文本到语音任务,我们根据采用扩散模型的阶段将方法分为三类:声学模型、声码器与端到端框架。此外,我们按从输入语音中去除或添加特定信号对各类语音增强任务进行分类。本综述也涵盖了实验结果的比较与讨论。

关键词

引用

@article{arxiv.2303.13336,
  title  = {A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI},
  author = {Chenshuang Zhang and Chaoning Zhang and Sheng Zheng and Mengchun Zhang and Maryam Qamar and Sung-Ho Bae and In So Kweon},
  journal= {arXiv preprint arXiv:2303.13336},
  year   = {2023}
}

备注

18 pages