中文

变分扩散模型用于语音超分辨率的调节与采样

音频与语音处理 2024-10-22 v3 声音 信号处理

摘要

近来,扩散模型(DMs)越来越多地用于音频处理任务,包括语音超分辨率(SR),其目标是在给定低分辨率语音语句的情况下恢复高频内容。这通常通过对噪声预测器网络以低分辨率音频为条件来实现。本文中,我们提出一种新颖的采样算法,通过 DMs 的反向采样过程传递低分辨率音频的信息。所提方法可作为原始采样过程的直接替代,并能显著提升现有工作的性能。此外,通过将所提采样方法与无条件 DM(即其噪声预测器无辅助输入的 DM)结合,我们可将其推广到广泛的 SR 设置。我们还凭借这一新颖公式在 VCTK 多说话人基准上取得了最先进的结果。

关键词

引用

@article{arxiv.2210.15793,
  title  = {Conditioning and Sampling in Variational Diffusion Models for Speech Super-Resolution},
  author = {Chin-Yun Yu and Sung-Lin Yeh and György Fazekas and Hao Tang},
  journal= {arXiv preprint arXiv:2210.15793},
  year   = {2024}
}

备注

Published at ICASSP 2023