低资源带口音普通话语音识别的深度神经网络声学建模方法研究
音频与语音处理
2024-06-17 v2 声音
摘要
已知汉语普通话受丰富的地域口音影响强烈,而每种口音的普通话语音均属低资源。因此,普通话语音识别的一项重要任务是恰当建模口音带来的声学变化。本文对一系列基于深度神经网络(DNN)的声学建模技术中口音信息的隐式与显式利用进行了研究。同时,本文结合并比较了多口音建模方法,包括多风格训练、多口音决策树状态绑定、DNN串联以及多级自适应网络(MLAN)串联隐马尔可夫模型(HMM)建模。在一个由四种地域口音构成的低资源带口音普通话语音识别任务上,提出了显式利用口音信息的改进MLAN串联HMM系统,在经过序列级区分性训练与自适应后,其字符错误率较基线口音无关DNN串联系统绝对降低0.8%–1.5%(相对降低6%–9%),显著更优。
引用
@article{arxiv.2201.09432,
title = {Investigation of Deep Neural Network Acoustic Modelling Approaches for Low Resource Accented Mandarin Speech Recognition},
author = {Xurong Xie and Xiang Sui and Xunying Liu and Lan Wang},
journal= {arXiv preprint arXiv:2201.09432},
year = {2024}
}
备注
Published in JOURNAL OF INTEGRATION TECHNOLOGY CNKI:SUN:JCJI.0.2015-06-003