通过半监督声学与语言模型训练改进低资源索马里语语音识别
计算与语言
2019-07-09 v1 机器学习
音频与语音处理
摘要
我们展示了索马里语自动语音识别(ASR)的改进,索马里语目前是一种极度缺乏资源的语言。这构成了联合国(UN)持续努力的一部分,即采用基于 ASR 的关键词 spotting 系统以支持非洲农村的 humanitarian relief 项目。仅使用 1.57 小时标注语音数据作为种子语料库,我们通过对 17.55 小时未转写语音应用半监督训练来扩充训练数据池。我们采用因子化时延神经网络(TDNN-F)进行声学建模,因其近期已被证明在资源匮乏情形下有效。我们执行了三次半监督训练轮次,每一轮的解码输出用于下一轮的声学模型训练。性能最佳一轮的自动转写用于语言模型增强。为确保自动转写质量,以解码器置信度作为阈值。相较基线,半监督方法所得的声学与语言模型在词错率(WER)与困惑度方面均有显著改善。引入自动生成的转写使语言模型困惑度提升 6.55%。在半监督训练中使用 17.55 小时索马里语音频数据,相对基线实现了 7.74% 的改进。
引用
@article{arxiv.1907.03064,
title = {Improved low-resource Somali speech recognition by semi-supervised acoustic and language model training},
author = {Astik Biswas and Raghav Menon and Ewald van der Westhuizen and Thomas Niesler},
journal= {arXiv preprint arXiv:1907.03064},
year = {2019}
}
备注
5 pages, 6 Tables, 3 figures, 22 references (Accepted at Interspeech 2019)