中文

基于 RNN-T 的流式多说话人语音识别

音频与语音处理 2021-02-22 v2 计算与语言 声音

摘要

近期研究表明端到端 ASR 系统能够识别多说话人的重叠语音。然而,所有已发表工作都假设推理时无延迟约束,而这大多数语音助手交互中并不成立。本工作聚焦于基于循环神经网络转导器(RNN-T)的多说话人语音识别,该模型已被证明在低延迟在线识别机制下提供高识别准确率。我们研究 RNN-T 多说话人模型训练的两种方法:确定性输出目标分配与排列不变训练。我们表明,在前一种情形中利用说话人顺序标签引导分离增强了 RNN-T 的高层说话人跟踪能力。除此之外,通过在单说话人与多说话人语句上的多风格训练,所得模型获得了对推理时说话人数量模糊的鲁棒性。我们的最佳模型在模拟 2 说话人 LibriSpeech 数据上取得 10.2% 的 WER,与此前报道的顶尖非流式模型(10.3%)相当,同时所提模型可直接应用于流式场景。

关键词

引用

@article{arxiv.2011.11671,
  title  = {Streaming Multi-speaker ASR with RNN-T},
  author = {Ilya Sklyar and Anna Piunova and Yulan Liu},
  journal= {arXiv preprint arXiv:2011.11671},
  year   = {2021}
}

备注

Accepted at ICASSP2021