利用母语信息改进口音语音识别
音频与语音处理
2019-04-22 v1
摘要
鉴于以英语为第二语言的双语使用者在全球人口中不断增加,口音语音识别一直是自动语音识别(ASR)系统的长期挑战。若将外语口音语音视为母语(L1)与英语(L2)的插值,使用能同时处理两种语言的模型将在口音语音的声学层面表现更好。在本研究中,我们探索了以英语和母语(西班牙语与印度诸语言)训练的端到端循环神经网络(RNN)系统如何能够利用母语数据来改进口音英语语音的性能。为此,我们考察了以母语进行预训练,以及多任务学习(MTL),其中主任务以母语英语训练,次要任务以西班牙语或印度诸语言训练。我们表明,所提出的 MTL 模型优于预训练方法,并胜过了仅以英语数据训练的基线模型。我们提出了一种新的 MTL 设置,其中次要任务以英语和母语同时使用相同输出集进行训练。所提出的场景取得了更好性能,相对于基线在西班牙裔和印度口音上分别获得 +11.95% 和 +17.55% 的字符错误率提升。
引用
@article{arxiv.1904.09038,
title = {Leveraging native language information for improved accented speech recognition},
author = {Shahram Ghorbani and John H. L. Hansen},
journal= {arXiv preprint arXiv:1904.09038},
year = {2019}
}
备注
Accepted at Interspeech 2018