利用多说话人 TTS 合成构音障碍语音用于构音障碍语音识别
音频与语音处理
2022-01-28 v1 计算与语言
声音
摘要
构音障碍是一种运动性言语障碍,常表现为因言语产生肌肉控制缓慢、不协调而导致的言语可懂度下降。自动语音识别(ASR)系统可帮助构音障碍说话者更有效地交流。要获得鲁棒的构音障碍专用 ASR,需要充足的训练语音,而这并不易得。近期多说话人端到端 TTS 系统的文本到语音(TTS)合成进展暗示了利用合成进行数据增强的可能性。本文旨在改进多说话人端到端 TTS 系统,以合成构音障碍语音来改进构音障碍专用 DNN-HMM ASR 的训练。在合成语音中,我们将构音障碍严重程度等级与停顿插入机制添加到音高、能量和时长等其他控制参数中。结果表明,在额外合成构音障碍语音上训练的 DNN-HMM 模型相较基线实现了 12.2% 的 WER 改善,而严重程度等级与停顿插入控制的加入使 WER 降低了 6.5%,显示了添加这些参数的有效性。音频样本可在以下网址获取
引用
@article{arxiv.2201.11571,
title = {Synthesizing Dysarthric Speech Using Multi-talker TTS for Dysarthric Speech Recognition},
author = {Mohammad Soleymanpour and Michael T. Johnson and Rahim Soleymanpour and Jeffrey Berry},
journal= {arXiv preprint arXiv:2201.11571},
year = {2022}
}
备注
Accepted ICASSP 2022