中文

基于扩散模型的语音增强在匹配与不匹配条件下使用Heun采样器

音频与语音处理 2024-09-10 v2 机器学习 声音

摘要

扩散模型是一类新型生成模型,近期已成功应用于语音增强。先前工作已证明其在不匹配条件下相比最先进的判别模型具有更优性能。然而,这些研究仅使用单一数据库进行训练和另一个数据库进行测试,使得结果高度依赖于特定数据库。此外,图像生成领域的最新进展在语音增强中仍大多未被探索,包括扩散模型的若干设计方面,如噪声调度或反向采样器。在本工作中,我们通过使用多个语音、噪声和双耳房间脉冲响应(BRIR)数据库来模拟不匹配的声学条件,系统评估了基于扩散的语音增强模型的泛化性能。我们还实验了此前未应用于语音增强的噪声调度和采样器。结果表明,所提系统显著受益于使用多个数据库进行训练,并在匹配和不匹配条件下均实现了优于最先进判别模型的性能。我们还表明,与语音增强中常用的采样器相比,基于Heun的采样器以更低的计算成本实现了更优性能。

关键词

引用

@article{arxiv.2312.02683,
  title  = {Diffusion-Based Speech Enhancement in Matched and Mismatched Conditions Using a Heun-Based Sampler},
  author = {Philippe Gonzalez and Zheng-Hua Tan and Jan Østergaard and Jesper Jensen and Tommy Sonne Alstrøm and Tobias May},
  journal= {arXiv preprint arXiv:2312.02683},
  year   = {2024}
}

备注

Accepted to ICASSP 2024