中文

EDSep:一种基于扩散的方法用于语音源分离

音频与语音处理 2025-01-28 v1 声音

摘要

生成模型因语音分离任务而受到广泛关注,其中扩散方法正受到探索。尽管扩散技术在生成任务中取得了显著成功,但其在语音分离上的应用仍面临挑战,主要包括收敛缓慢和分离效果次优。为此,本文引入 EDSep,一种基于通过随机微分方程(SDE)进行得分匹配的单声道方法,以提高扩散-based 语音分离的有效性。该方法通过优化训练和采样效率来增强语音源分离的生成式建模。具体而言,提出了一种新型 denoiser 函数来逼近数据分布,获得理想的 denoiser 输出。此外,精心设计的随机采样器用于解决采样过程中的逆 SDE,从而逐步分离语音混合信号。在 WSJ0-2mix、LRS2-2mix 和 VoxCeleb2-2mix 等数据库上的大量实验表明,我们提出的方法在现有扩散和判别模型中表现出优越性能,验证了其有效性。

关键词

引用

@article{arxiv.2501.15965,
  title  = {EDSep: An Effective Diffusion-Based Method for Speech Source Separation},
  author = {Jinwei Dong and Xinsheng Wang and Qirong Mao},
  journal= {arXiv preprint arXiv:2501.15965},
  year   = {2025}
}