中文

基于条件扩散模型的目标语音提取

音频与语音处理 2023-08-21 v2 声音

摘要

基于扩散模型的语音增强近年来受到越来越多的关注,因为它能够生成非常自然的增强信号,并且对未见过的条件具有良好泛化能力。扩散模型已被探索用于语音增强的若干子任务,例如语音去噪、去混响和源分离。本文中,我们研究其在目标语音提取(TSE)中的使用,该任务旨在从多说话人混合信号中估计目标说话人的干净语音信号。TSE 通过以标识目标说话人的线索来条件化提取过程得以实现。我们展示了可利用以该线索为条件的条件扩散模型来实现 TSE。此外,我们引入集成推理以减少由扩散过程引起的潜在提取错误。在 Libri2mix 语料库上的实验中,我们表明所提出的基于扩散模型的 TSE 结合集成推理优于一个可比较的以判别方式训练的 TSE 系统。

关键词

引用

@article{arxiv.2308.03987,
  title  = {Target Speech Extraction with Conditional Diffusion Model},
  author = {Naoyuki Kamo and Marc Delcroix and Tomohiro Nakatani},
  journal= {arXiv preprint arXiv:2308.03987},
  year   = {2023}
}

备注

5 pages, 4 figures, Interspeech2023