口音与声学联合建模的多口音语音识别
计算与语言
2018-02-09 v1 声音
音频与语音处理
摘要
自动语音识别系统的性能随着训练与测试场景间不匹配程度的增加而下降。说话人口音的差异是此类不匹配的一个重要来源。处理多口音的传统方法是在训练时汇集若干口音的数据,并以多任务方式构建单一模型,其中任务对应于各个口音。在本文中,我们探索了一种替代模型,其中联合学习一个口音分类器与一个多任务声学模型。在美式英语 Wall Street Journal 与英式英语 Cambridge 语料库上的实验表明,我们的联合模型优于强大的多任务声学模型基线。我们在英式英语上获得了 5.94% 的词错误率相对提升,在美式英语上获得了 9.47% 的相对提升。这说明联合利用口音信息建模可提升声学模型性能。
引用
@article{arxiv.1802.02656,
title = {Joint Modeling of Accents and Acoustics for Multi-Accent Speech Recognition},
author = {Xuesong Yang and Kartik Audhkhasi and Andrew Rosenberg and Samuel Thomas and Bhuvana Ramabhadran and Mark Hasegawa-Johnson},
journal= {arXiv preprint arXiv:1802.02656},
year = {2018}
}
备注
Accepted in The 43rd IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP2018)