中文

基于扩散模型的零样本二重唱人声分离

音频与语音处理 2024-10-22 v2 声音

摘要

在近期研究中,扩散模型已展现出作为解决音频逆问题先验的潜力。这些模型使我们能够通过操控扩散过程,从给定观测信号下目标信号的后验分布中采样。然而,当分离同类型音频源(如二重唱人声)时,扩散过程学到的先验可能不足以在分离音频中保持源身份的一致性。例如,演唱者可能偶尔从一个变为另一个。解决该问题将有助于在无大量配对数据的情况下分离合唱团中的声源或音色相似多种乐器的混合。本文在二重唱人声分离背景下考察此问题,并提出一种通过将混合信号分割为重叠片段并以自回归方式、以前一片段为条件进行后验采样来强制演唱者身份一致性的方法。我们在 MedleyVox 数据集上评估了所提方法,结果表明其优于朴素后验采样基线。我们的源代码与预训练模型公开于 https://github.com/iamycy/duet-svs-diffusion。

关键词

引用

@article{arxiv.2311.07345,
  title  = {Zero-Shot Duet Singing Voices Separation with Diffusion Models},
  author = {Chin-Yun Yu and Emilian Postolache and Emanuele Rodolà and György Fazekas},
  journal= {arXiv preprint arXiv:2311.07345},
  year   = {2024}
}

备注

9 pages, 1 figure. Published at Sound Demixing Workshop 2023