数据与知识驱动的多语言训练方法以提升印度语语音识别系统性能
音频与语音处理
2022-01-25 v1 计算与语言
声音
摘要
我们提出数据与知识驱动的方法,通过汇拢多种源语言的语音数据,对目标语言的自动语音识别(ASR)系统进行多语言训练。利用印度语言间的声学相似性,我们实现了两种方法。在音素/senone 映射中,深度神经网络(DNN)学习将一种语言的 senone 或音素映射到其他语言,并修改源语言的转写文本,使其能与目标语言数据一起用于训练和微调目标语言 ASR 系统。在另一种方法中,我们通过训练多任务 DNN(MTDNN)在不同输出层预测每种语言的 senone,同时建模所有语言的声学信息。交叉熵损失与权重更新过程被修改,使得若特征向量属于某特定语言,则仅更新共享层与负责预测该语言 senone 类别的输出层。在低资源设定(LRS)下,使用泰米尔语、泰卢固语和古吉拉特语各 40 小时转写数据训练。基于 DNN 的 senone 映射技术相较基线系统,对泰米尔语、古吉拉特语和泰卢固语分别给出 9.66%、7.2% 和 15.21% 的词错率(WER)相对提升。在中资源设定(MRS)下,使用泰米尔语、卡纳达语和印地语分别 160、275 和 135 小时数据,该技术对泰米尔语、卡纳达语和印地语分别给出更好的相对提升 13.94%、10.28% 和 27.24%。LRS 下结合 senone 映射训练的 MTDNN,对泰米尔语、古吉拉特语和泰卢固语分别给出更高的相对 WER 提升 15.0%、17.54% 和 16.06%,而在 MRS 下,对泰米尔语、卡纳达语和印地语分别观察到 21.24%、21.05% 和 30.17% 的提升。
引用
@article{arxiv.2201.09494,
title = {Data and knowledge-driven approaches for multilingual training to improve the performance of speech recognition systems of Indian languages},
author = {A. Madhavaraj and Ramakrishnan Angarai Ganesan},
journal= {arXiv preprint arXiv:2201.09494},
year = {2022}
}