中文

StoRM:一种基于扩散的随机再生模型用于语音增强与去混响

音频与语音处理 2024-03-13 v2 机器学习 声音

摘要

扩散模型在缩小语音增强中预测方法与生成方法之间的性能差距方面表现出很强的能力。我们已经表明,对于非加性失真类型或在失配条件下评估时,它们甚至可能优于其预测对应方法。然而,扩散模型存在高计算负担,主要是因为它们需要对每个反向扩散步骤运行神经网络,而预测方法仅需一次前向传播。由于扩散模型是生成方法,它们在不利条件下可能产生发声和呼吸伪影。相比之下,在此类困难场景中,预测模型通常不会产生此类伪影,而是倾向于扭曲目标语音,从而降低语音质量。在这项工作中,我们提出了一种随机再生方法,其中将由预测模型给出的估计作为进一步扩散的引导。我们表明,所提方法利用预测模型去除发声和呼吸伪影,同时借助扩散模型生成非常高质量的样本,即使在不利条件下也是如此。我们进一步表明,该方法能够使用具有更少扩散步骤的更轻量采样方案而不牺牲质量,从而将计算负担降低一个数量级。源代码和音频示例可在线获取(https://uhh.de/inf-sp-storm)。

关键词

引用

@article{arxiv.2212.11851,
  title  = {StoRM: A Diffusion-based Stochastic Regeneration Model for Speech Enhancement and Dereverberation},
  author = {Jean-Marie Lemercier and Julius Richter and Simon Welker and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2212.11851},
  year   = {2024}
}

备注

Published in IEEE/ACM Transactions on Audio, Speech and Language Processing, 2023