中文

通过微调自监督成人语音表征改进儿童语音识别

计算与语言 2022-11-16 v1 声音 音频与语音处理

摘要

儿童语音识别是构建包容性语音技术中的一个重要却很大程度上被忽视的领域。阻碍该领域进展的主要挑战是缺乏充足的儿童语音语料库;然而,自监督学习的最新进展为克服这一数据稀缺问题提供了新机遇。本文利用自监督成人语音表征,并使用三个知名儿童语音语料库来构建儿童语音识别模型。我们评估了在母语与非母语儿童语音上微调的性能,考察了跨域儿童语料库的影响,并探究了使微调模型优于最先进(SOTA)成人模型所需的最少儿童语音量。我们还分析了不同年龄儿童的语音识别性能。结果表明,使用跨域儿童语料库微调可为母语与非母语儿童语音分别带来高达 46.08% 和 45.53% 的相对提升,以及 14.70% 和 31.10% 的绝对提升。我们还显示,仅需少至 5 小时的转写儿童语音,即可微调出优于在 960 小时成人语音上微调的 SOTA 成人模型的儿童语音识别系统。

关键词

引用

@article{arxiv.2211.07769,
  title  = {Improving Children's Speech Recognition by Fine-tuning Self-supervised Adult Speech Representations},
  author = {Renee Lu and Mostafa Shahin and Beena Ahmed},
  journal= {arXiv preprint arXiv:2211.07769},
  year   = {2022}
}

备注

Under-review @ Speech Communication Journal