中文

基于扩散概率模型的噪声感知语音增强

音频与语音处理 2024-06-05 v2 机器学习 声音

摘要

随着扩散模型近期的进展,生成式语音增强(SE)因其在未见测试噪声上的巨大潜力而引发了研究热潮。然而,现有工作主要关注干净语音的固有属性,未充分利用真实世界中变化的噪声信息。本文提出一种噪声感知语音增强(NASE)方法,提取噪声特定信息以引导扩散模型中的反向过程。具体而言,我们设计了一个噪声分类(NC)模型来生成声学嵌入作为噪声条件器,以引导反向去噪过程。同时,设计了多任务学习方案联合优化 SE 与 NC 任务,以增强条件器的噪声特异性。NASE 被证明是一个即插即用的模块,可泛化至任意扩散 SE 模型。在 VB-DEMAND 数据集上的实验表明,NASE 有效提升了多种主流扩散 SE 模型,尤其在未见噪声上。

关键词

引用

@article{arxiv.2307.08029,
  title  = {Noise-aware Speech Enhancement using Diffusion Probabilistic Model},
  author = {Yuchen Hu and Chen Chen and Ruizhe Li and Qiushi Zhu and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2307.08029},
  year   = {2024}
}

备注

5 pages, 2 figures, Accepted by InterSpeech 2024