基于吸引子的未知说话人数目多话语语音分离
音频与语音处理
2025-05-23 v1 声音
摘要
本文探讨了单通道语音分离问题,其中说话人数量未知,且每个说话人可能说出多个话语。我们提出了一种语音分离模型,该模型通过集成一个吸引子模块,能够同时执行分离、动态估计说话人数量并检测单个说话人的活动。所提出的系统通过引入一种基于吸引子的架构,有效地结合了局部和全局时间建模以应对多话语场景,其性能优于现有方法。为了在有混响和噪声的条件下评估该方法,我们通过将Librispeech语音信号与WHAM!噪声信号相结合,合成了一个多说话人多话语数据集。结果表明,所提出的系统能准确估计声源数量。在已知和未知声源数量的场景下,该系统都能有效检测声源活动,并将相应的话语分离到正确的输出中。
引用
@article{arxiv.2505.16607,
title = {Attractor-Based Speech Separation of Multiple Utterances by Unknown Number of Speakers},
author = {Yuzhu Wang and Archontis Politis and Konstantinos Drossos and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2505.16607},
year = {2025}
}
备注
5 pages, 4 figures, accepted by Interspeech 2025