中文

用于多方语音流式识别的多轮 RNN-T

音频与语音处理 2022-02-11 v2 计算与语言 声音

摘要

对具有未知说话人数量单通道远场录音的自动语音识别(ASR)传统上由级联模块处理。近期研究表明,端到端(E2E)多说话人 ASR 模型可比模块化系统获得更优识别准确率。然而,这些模型因其对完整音频上下文的依赖而无法保证实时适用性。本工作将实时适用性作为模型设计的第一优先级,并解决先前多说话人循环神经网络转导器(MS-RNN-T)工作中的若干挑战。首先,我们在训练期间引入即时重叠语音仿真,在 LibriSpeechMix 测试集上取得 14% 的相对词错率(WER)提升。其次,我们提出一种新颖的多轮 RNN-T(MT-RNN-T)模型,采用基于重叠的目标排列策略,可在不改变模型架构的情况下泛化到任意数量说话人。我们考察了训练期间所见最大说话人数量对 MT-RNN-T 在 LibriCSS 测试集上性能的影响,并报告了相较双说话人 MS-RNN-T 达 28% 的相对 WER 提升。第三,我们实验了一种丰富转写策略,用于多方语音的联合识别与分割。通过深入分析,我们讨论了所提系统的潜在缺陷以及有前景的未来研究方向。

关键词

引用

@article{arxiv.2112.10200,
  title  = {Multi-turn RNN-T for streaming recognition of multi-party speech},
  author = {Ilya Sklyar and Anna Piunova and Xianrui Zheng and Yulan Liu},
  journal= {arXiv preprint arXiv:2112.10200},
  year   = {2022}
}

备注

Accepted by ICASSP 2022