中文

未知源数下的多说话人语音识别:源计数、分离与识别的联合训练

音频与语音处理 2020-12-22 v3 计算与语言 声音

摘要

大多数多说话人重叠语音分离与识别方法都假设同时活跃说话人的数量已知,但在实际场景中该数量通常未知。为此,我们扩展了一种迭代语音提取系统,加入源计数机制,并将其与单说话人语音识别器结合,构建了首个面向未知活跃说话人数的端到端多说话人自动语音识别系统。我们的实验在 WSJ0-2mix 与 WSJ0-3mix 的仿真干净混合语音上,于计数准确率、源分离与语音识别方面展现出极具前景的性能。其中,我们在 WSJ0-2mix 数据库上取得了新的 SOTA 词错误率。此外,如 WSJ0-4mix 数据库实验所示,我们的系统对多于训练时所见说话人数的情况也具有良好的泛化能力。

关键词

引用

@article{arxiv.2006.02786,
  title  = {Multi-talker ASR for an unknown number of sources: Joint training of source counting, separation and ASR},
  author = {Thilo von Neumann and Christoph Boeddeker and Lukas Drude and Keisuke Kinoshita and Marc Delcroix and Tomohiro Nakatani and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2006.02786},
  year   = {2020}
}

备注

5 pages, INTERSPEECH 2020