中文

无监督节奏与语音转换以提升构音障碍语音的 ASR 性能

音频与语音处理 2025-06-03 v1 人工智能 机器学习 声音

摘要

由于说话人间的高变异性和缓慢的语速,自动语音识别(ASR)系统在处理构音障碍语音时面临困难。为了解决这一问题,我们探索了构音障碍到健康语音的转换,以提升 ASR 性能。我们的方法扩展了节奏与语音(RnV)转换框架,引入了一种适用于构音障碍语音的基于音节的节奏建模方法。我们通过训练 LF-MMI 模型并在转换后的语音上微调 Whisper 来评估其对 ASR 的影响。在 Torgo 语料库上的实验表明,LF-MMI 实现了显著的词错率降低,特别是对于更严重的构音障碍病例,而在转换数据上微调 Whisper 对其性能的影响微乎其微。这些结果突显了无监督节奏与语音转换在构音障碍 ASR 中的潜力。代码可在:https://github.com/idiap/RnV 获取。

关键词

引用

@article{arxiv.2506.01618,
  title  = {Unsupervised Rhythm and Voice Conversion to Improve ASR on Dysarthric Speech},
  author = {Karl El Hajal and Enno Hermann and Sevada Hovsepyan and Mathew Magimai. -Doss},
  journal= {arXiv preprint arXiv:2506.01618},
  year   = {2025}
}

备注

Accepted at Interspeech 2025