中文

基于基频特征归一化与数据增强的儿童语音识别

音频与语音处理 2021-02-19 v1 声音

摘要

由于适龄教育技术的重要性,亟需面向低龄儿童的自动语音识别(ASR)系统。由于缺乏公开可用的低龄儿童语音数据,必须考虑特征归一化和数据增强等特征提取策略,以成功训练儿童 ASR 系统。本研究提出一种基于共振峰与基频(fof_o)之间关系的特征归一化和数据增强方法用于儿童 ASR 的新技术。该 fof_o 特征归一化和数据增强技术均在梅尔域中作为频移实现。这些技术在儿童朗读语音 ASR 任务上进行了评估。儿童 ASR 系统通过在成人语音上训练的基于 BLSTM 的声学模型进行自适应得到。在 OGI Kids' Speech Corpus 上测试时,同时使用 fof_o 归一化和数据增强相比基线取得了 19.3% 的相对词错误率(WER)提升,且所得儿童 ASR 系统达到了该语料库上目前报道的最佳 WER。

关键词

引用

@article{arxiv.2102.09106,
  title  = {Fundamental Frequency Feature Normalization and Data Augmentation for Child Speech Recognition},
  author = {Gary Yeung and Ruchao Fan and Abeer Alwan},
  journal= {arXiv preprint arXiv:2102.09106},
  year   = {2021}
}

备注

To be published in IEEE ICASSP