中文

基于联合说话人识别的流式多说话人语音识别

声音 2021-04-07 v1 计算与语言

摘要

在会议和对话等多说话人场景中,语音处理系统通常需要转录音频并识别说话人,以供下游应用使用。由于重叠语音在此情况下十分常见,传统方法通常以级联方式解决该问题,涉及独立训练的语音分离、语音识别和说话人识别。本文提出流式解混、识别与识别换能器(SURIT)——一种以端到端流式方式处理该问题的新框架。SURIT采用循环神经网络换能器(RNN-T)作为语音识别和说话人识别的骨干网络。我们在LibrispeechMix数据集(一个从Librispeech派生的多说话人数据集)上验证了我们的想法,并给出了令人鼓舞的结果。

关键词

引用

@article{arxiv.2104.02109,
  title  = {Streaming Multi-talker Speech Recognition with Joint Speaker Identification},
  author = {Liang Lu and Naoyuki Kanda and Jinyu Li and Yifan Gong},
  journal= {arXiv preprint arXiv:2104.02109},
  year   = {2021}
}

备注

5 pages, 2 figures, submitted to Interspeech 2021