中文

MIMO-SPEECH:端到端多通道多说话人语音识别

音频与语音处理 2019-10-17 v2 计算与语言 声音

摘要

近来,端到端方法已在单声道多说话人语音识别中证明其有效性。然而,高词错率 (WER) 仍阻碍这些系统用于实际应用。另一方面,多通道信号中的空间信息已在远场语音识别任务中被证明有帮助。在这项工作中,我们提出一种新颖的神经序列到序列 (seq2seq) 架构 MIMO-Speech,它将原始 seq2seq 扩展以处理多通道输入与多通道输出,从而可充分建模多通道多说话人语音分离与识别。MIMO-Speech 是一个完全神经端到端框架,仅通过 ASR 准则优化。它由以下部分组成:1) 单声道掩蔽网络,2) 多源神经波束成形器,以及 3) 多输出语音识别模型。经此处理,输入的重叠语音被直接映射至文本序列。我们进一步采用课程学习策略,充分利用训练集以提升性能。在空间化的 wsj1-2mix 语料库上的实验表明,与单通道系统相比,我们的模型可实现超过 60% 的 WER 降低,且通过上述分离函数获得高质量增强信号 (SI-SDR = 23.1 dB)。

关键词

引用

@article{arxiv.1910.06522,
  title  = {MIMO-SPEECH: End-to-End Multi-Channel Multi-Speaker Speech Recognition},
  author = {Xuankai Chang and Wangyou Zhang and Yanmin Qian and Jonathan Le Roux and Shinji Watanabe},
  journal= {arXiv preprint arXiv:1910.06522},
  year   = {2019}
}

备注

Accepted at ASRU 2019