中文

Diffiner:一种基于扩散的生成式语音增强精炼器

音频与语音处理 2023-08-31 v3 机器学习 声音

摘要

尽管基于深度神经网络(DNN)的语音增强(SE)方法优于以往非DNN的方法,但它们常使生成输出的感知质量下降。为解决此问题,我们引入了一种基于DNN的生成式精炼器Diffiner,旨在改善经SE方法预处理后的语音感知质量。我们利用仅由干净语音组成的数据集训练了一个基于扩散的生成模型。随后,我们的精炼器将经由去噪扩散修复新生成的干净部分,有效地混入由前置SE方法引起的退化与失真部分,从而得到精炼后的语音。一旦我们的精炼器在一组干净语音上完成训练,便可应用于多种SE方法,而无需针对每个SE模块额外训练。因此,我们的精炼器可作为一种面向SE方法的多功能后处理模块,并在模块化方面具有高潜力。实验结果表明,无论使用何种前置SE方法,我们的方法均提升了语音感知质量。

关键词

引用

@article{arxiv.2210.17287,
  title  = {Diffiner: A Versatile Diffusion-based Generative Refiner for Speech Enhancement},
  author = {Ryosuke Sawata and Naoki Murata and Yuhta Takida and Toshimitsu Uesaka and Takashi Shibuya and Shusuke Takahashi and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2210.17287},
  year   = {2023}
}

备注

Accepted by Interspeech 2023