中文

用于ASR数据增强的构音障碍语音准确合成

声音 2023-08-17 v1 机器学习 音频与语音处理

摘要

构音障碍是一种运动性言语障碍,常表现为由于言语产生肌肉控制缓慢且不协调而导致言语可懂度下降。自动语音识别(ASR)系统可帮助构音障碍说话者更有效地交流。然而,鲁棒的构音障碍专用ASR需要大量训练语音,而构音障碍说话者难以轻易获取此类语音。本文提出一种新的构音障碍语音合成方法,用于ASR训练数据增强。不同严重程度下构音障碍自然语音在韵律与声学特征上的差异,是构音障碍语音建模、合成与增强的重要组成。对于构音障碍语音合成,通过加入构音障碍严重程度系数与停顿插入模型,实现改进的神经多说话人TTS(文本到语音),以合成不同严重程度的构音障碍语音。为评估所合成训练数据对ASR的有效性,使用了构音障碍专用语音识别。结果表明,在额外合成构音障碍语音上训练的DNN-HMM模型相较基线实现12.2%的WER(词错率)提升,且加入严重程度与停顿插入控制使WER降低6.5%,显示了加入这些参数的有效性。基于TORGO数据库的整体结果表明,使用构音障碍合成语音增加训练中构音障碍模式语音的量,对构音障碍ASR系统有显著影响。此外,我们进行了主观评价以评估合成语音的构音障碍程度与相似度。主观评价显示,合成语音的感知构音障碍程度与真实构音障碍语音相似,尤其在较高严重程度下。

关键词

引用

@article{arxiv.2308.08438,
  title  = {Accurate synthesis of Dysarthric Speech for ASR data augmentation},
  author = {Mohammad Soleymanpour and Michael T. Johnson and Rahim Soleymanpour and Jeffrey Berry},
  journal= {arXiv preprint arXiv:2308.08438},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2201.11571