中文

通过TTS个性化改进运动性障碍语音转文本

声音 2025-08-11 v1 人机交互

摘要

我们提出了一个案例研究,开发针对一位患有严重运动性障碍的匈牙利语说话者的定制化语音识别系统。现有的先进自动语音识别(ASR)模型在零样本识别运动性障碍语音时难以实现,导致高错误率。为提高受限真实运动性障碍数据下的性能,我们使用通过个性化文本转语音(TTS)系统生成的合成语音对ASR模型进行微调。我们引入一种方法,通过利用该说话者的既往录音和说话人嵌入插值,生成可控制严重程度的合成运动性障碍语音,从而在不同的障碍程度上进行ASR微调。在真实和合成运动性障碍语音上的微调将字符错误率(CER)从零样本情况下的 36-51% 降低至 7.3%。我们的单语种 FastConformer_Hu ASR 模型在相同数据上显著优于 Whisper-turbo,合成语音的纳入为 CER 降低了约 18%。这些结果凸显了针对严重语音障碍患者的个性化ASR系统在提高可访问性方面的潜力。

关键词

引用

@article{arxiv.2508.06391,
  title  = {Improved Dysarthric Speech to Text Conversion via TTS Personalization},
  author = {Péter Mihajlik and Éva Székely and Piroska Barta and Máté Soma Kádár and Gergely Dobsinszki and László Tóth},
  journal= {arXiv preprint arXiv:2508.06391},
  year   = {2025}
}