中文

提升基于 RNN-Transducer 语音识别对不流利语的鲁棒性

计算与语言 2020-12-14 v1 音频与语音处理

摘要

基于循环神经网络转导器(Recurrent Neural Network Transducer, RNN-T)的自动语音识别(Automatic Speech Recognition, ASR)正日益受到语音界的关注。我们研究了以部分词为重点、旨在提升 RNN-T ASR 对语音不流利现象鲁棒性的数据筛选与准备策略。评估中我们使用了干净数据、含不流利现象的数据,以及一组受口吃影响的语音独立数据集。我们表明,在训练集中加入少量含不流利现象的数据后,在不流利与口吃测试上的识别准确率得到提升。增加含不流利现象的训练数据量可带来额外收益,且不会降低干净数据上的性能。我们还表明,用专用符号替换部分词有助于在不流利与口吃语句上获得更佳准确率。我们最佳模型的评估显示,在这两个评估集上相对词错率(WER)分别降低了 22.5% 和 16.4%。

关键词

引用

@article{arxiv.2012.06259,
  title  = {Improved Robustness to Disfluencies in RNN-Transducer Based Speech Recognition},
  author = {Valentin Mendelev and Tina Raissi and Guglielmo Camporese and Manuel Giollo},
  journal= {arXiv preprint arXiv:2012.06259},
  year   = {2020}
}