中文

基于吸引子的未知说话人数目多话语语音分离

音频与语音处理 2025-05-23 v1 声音

摘要

本文探讨了单通道语音分离问题,其中说话人数量未知,且每个说话人可能说出多个话语。我们提出了一种语音分离模型,该模型通过集成一个吸引子模块,能够同时执行分离、动态估计说话人数量并检测单个说话人的活动。所提出的系统通过引入一种基于吸引子的架构,有效地结合了局部和全局时间建模以应对多话语场景,其性能优于现有方法。为了在有混响和噪声的条件下评估该方法,我们通过将Librispeech语音信号与WHAM!噪声信号相结合,合成了一个多说话人多话语数据集。结果表明,所提出的系统能准确估计声源数量。在已知和未知声源数量的场景下,该系统都能有效检测声源活动,并将相应的话语分离到正确的输出中。

关键词

引用

@article{arxiv.2505.16607,
  title  = {Attractor-Based Speech Separation of Multiple Utterances by Unknown Number of Speakers},
  author = {Yuzhu Wang and Archontis Politis and Konstantinos Drossos and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2505.16607},
  year   = {2025}
}

备注

5 pages, 4 figures, accepted by Interspeech 2025