中文

通过增强儿童语音提升儿童语音识别

计算与语言 2025-01-09 v1 声音 音频与语音处理

摘要

领先的自动语音识别(ASR)对儿童语音显示出次优的性能。儿童语音的稀缺性限制了儿童语音识别(CSR)的开发。因此,我们研究了从现有儿童说话者(通过单语种)和额外(新)儿童说话者(通过跨语种[Dutch-to-German])进行儿童语音转换(VC)。结果表明,跨语种儿童语音转换显著改善了儿童 ASR 性能。实验考察了儿童语音转换生成数据数量对微调(FT) ASR 模型的影响,结果显示对于我们的 FT-Conformer 模型和 FT-Whisper 模型,使用两倍增强可将 WER 降低约 3% 绝对值;对于从头训练的模型,使用六倍增强可提升 3.6% 绝对 WER。此外,使用少量“高质量”VC 生成数据即可实现与最佳 FT 模型相似的效果。

关键词

引用

@article{arxiv.2406.10284,
  title  = {Improving child speech recognition with augmented child-like speech},
  author = {Yuanyuan Zhang and Zhengjun Yue and Tanvina Patel and Odette Scharenborg},
  journal= {arXiv preprint arXiv:2406.10284},
  year   = {2025}
}

备注

5 pages, 1 figure Accepted to INTERSPEECH 2024