利用辅助任务改进基于RNN Transducer的ASR
计算与语言
2020-11-10 v2 声音
音频与语音处理
摘要
具有单一神经网络端到端自动语音识别(ASR)模型近来相比传统混合语音识别器展现出最先进的结果。具体而言,循环神经网络转导器(RNN-T)在各种基准上显示了有竞争力的ASR性能。在本工作中,我们考察RNN-T可通过执行辅助任务实现更好ASR准确率的方法。我们提出(i)使用与主要RNN-T ASR任务相同的辅助任务,以及(ii)如传统混合建模中那样执行上下文相关字素状态预测。在转写具有不同训练数据规模的社交媒体视频时,我们首先在三种语言上评估流式ASR性能:罗马尼亚语、土耳其语和德语。我们发现两种提出的方法均提供一致的改进。接下来,我们观察到两个辅助任务在学习用于RNN-T准则的深度transformer编码器方面均展现效能,从而实现有竞争力的结果——在LibriSpeech test-clean/other上2.0%/4.2%的WER——相较于先前性能最优的模型。
引用
@article{arxiv.2011.03109,
title = {Improving RNN Transducer Based ASR with Auxiliary Tasks},
author = {Chunxi Liu and Frank Zhang and Duc Le and Suyoun Kim and Yatharth Saraf and Geoffrey Zweig},
journal= {arXiv preprint arXiv:2011.03109},
year = {2020}
}
备注
Accepted for publication at IEEE Spoken Language Technology Workshop (SLT), 2021