基于 RNN-T 的流式多说话人语音识别
音频与语音处理
2021-02-22 v2 计算与语言
声音
摘要
近期研究表明端到端 ASR 系统能够识别多说话人的重叠语音。然而,所有已发表工作都假设推理时无延迟约束,而这大多数语音助手交互中并不成立。本工作聚焦于基于循环神经网络转导器(RNN-T)的多说话人语音识别,该模型已被证明在低延迟在线识别机制下提供高识别准确率。我们研究 RNN-T 多说话人模型训练的两种方法:确定性输出目标分配与排列不变训练。我们表明,在前一种情形中利用说话人顺序标签引导分离增强了 RNN-T 的高层说话人跟踪能力。除此之外,通过在单说话人与多说话人语句上的多风格训练,所得模型获得了对推理时说话人数量模糊的鲁棒性。我们的最佳模型在模拟 2 说话人 LibriSpeech 数据上取得 10.2% 的 WER,与此前报道的顶尖非流式模型(10.3%)相当,同时所提模型可直接应用于流式场景。
引用
@article{arxiv.2011.11671,
title = {Streaming Multi-speaker ASR with RNN-T},
author = {Ilya Sklyar and Anna Piunova and Yulan Liu},
journal= {arXiv preprint arXiv:2011.11671},
year = {2021}
}
备注
Accepted at ICASSP2021