无监督节奏与语音转换以提升构音障碍语音的 ASR 性能
音频与语音处理
2025-06-03 v1 人工智能
机器学习
声音
摘要
由于说话人间的高变异性和缓慢的语速,自动语音识别(ASR)系统在处理构音障碍语音时面临困难。为了解决这一问题,我们探索了构音障碍到健康语音的转换,以提升 ASR 性能。我们的方法扩展了节奏与语音(RnV)转换框架,引入了一种适用于构音障碍语音的基于音节的节奏建模方法。我们通过训练 LF-MMI 模型并在转换后的语音上微调 Whisper 来评估其对 ASR 的影响。在 Torgo 语料库上的实验表明,LF-MMI 实现了显著的词错率降低,特别是对于更严重的构音障碍病例,而在转换数据上微调 Whisper 对其性能的影响微乎其微。这些结果突显了无监督节奏与语音转换在构音障碍 ASR 中的潜力。代码可在:https://github.com/idiap/RnV 获取。
引用
@article{arxiv.2506.01618,
title = {Unsupervised Rhythm and Voice Conversion to Improve ASR on Dysarthric Speech},
author = {Karl El Hajal and Enno Hermann and Sevada Hovsepyan and Mathew Magimai. -Doss},
journal= {arXiv preprint arXiv:2506.01618},
year = {2025}
}
备注
Accepted at Interspeech 2025