中文

基于文本到失语性语音合成的人工语音识别训练数据增强

声音 2024-06-14 v1 音频与语音处理

摘要

自动语音识别(ASR)近年来取得了显著进展,具有显著潜力,能够为失语患者(PwD)在补充和替代沟通(AAC)和居家环境系统中提供访问。然而,失语性自动语音识别(DASR)的进展受限于失语语音的高变异性以及公共失语性训练数据的稀缺。本文证明,使用文本到失语性语音(TTDS)合成进行数据增强,对微调大型 ASR 模型对 DASR 有效。具体而言,基于扩散的文本到语音(TTS)模型可产生与失语性语音相似的语音样本,用作微调 ASR 基础模型(本例为 Whisper)的额外训练数据。结果表明,所提出的多说话者基于扩散的 TTDS 数据增强方法在合成指标和 ASR 性能方面均优于当前 DASR baseline。

关键词

引用

@article{arxiv.2406.08568,
  title  = {Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis},
  author = {Wing-Zin Leung and Mattias Cross and Anton Ragni and Stefan Goetze},
  journal= {arXiv preprint arXiv:2406.08568},
  year   = {2024}
}

备注

Accepted for Interspeech 2024