中文

利用日期时间与位置感知提升 RNN-T 语音识别性能

音频与语音处理 2021-06-17 v2 计算与语言

摘要

在本文中,我们探讨了将上下文信息融入基于循环神经网络换能器(RNN-T)的自动语音识别(ASR)模型,以改善虚拟助手的语音识别能力。具体而言,我们利用从说话时刻提取的时间元信息以及近似位置信息,使 ASR 具备上下文感知能力。我们表明,这些上下文信息在单独使用时,相对于基线整体性能提升高达 3.48%;而当上下文组合使用时,模型学习到互补特征,识别率提升 4.62%。在特定领域上,这些上下文信号带来的改进高达 11.5%,且在其他领域无显著退化。我们使用在 30K 小时和 10K 小时规模数据上训练的模型进行实验。我们表明,10K 小时数据集上的提升幅度远大于 30K 小时数据集所得。我们的结果表明,在训练 ASR 模型的数据有限时,上下文信号可显著提升性能。

关键词

引用

@article{arxiv.2106.06183,
  title  = {Improving RNN-T ASR Performance with Date-Time and Location Awareness},
  author = {Swayambhu Nath Ray and Soumyajit Mitra and Raghavendra Bilgi and Sri Garimella},
  journal= {arXiv preprint arXiv:2106.06183},
  year   = {2021}
}

备注

To appear in TSD 2021