流式端到端多说话人语音识别
声音
2021-05-12 v2 计算与语言
音频与语音处理
摘要
端到端多说话人语音识别因在对话与会议转写等应用中的巨大潜力,正成为语音界新兴的研究趋势。据我们所知,所有现有研究工作均受限于离线场景。本工作中,我们提出流式分离与识别转导器(SURT)用于端到端多说话人语音识别。我们的模型采用循环神经网络转导器(RNN-T)作为主干,可满足各种时延约束。我们研究了基于说话人区分编码器和掩码编码器两种不同的模型架构。为训练该模型,我们考察了广泛使用的排列不变训练(PIT)方法与启发式误差分配训练(HEAT)方法。基于在公开可用的LibriSpeechMix数据集上的实验,我们表明HEAT相比PIT能取得更好的准确率,且具150毫秒算法时延约束的SURT模型在准确率上优于基于离线序列到序列的基线模型。
引用
@article{arxiv.2011.13148,
title = {Streaming end-to-end multi-talker speech recognition},
author = {Liang Lu and Naoyuki Kanda and Jinyu Li and Yifan Gong},
journal= {arXiv preprint arXiv:2011.13148},
year = {2021}
}
备注
5 pages, 3 figures. Accepted to IEEE Signal Processing Letters 2021