中文

从成人到儿童的语音识别迁移学习:评估、分析与建议

音频与语音处理 2018-05-15 v1 计算与语言 声音

摘要

儿童语音识别具有挑战性,主要源于儿童生理与发音特征及表达固有的高变异性。由于儿童生命阶段快速发育变化,这种变异性既体现在声学构造上也体现在语言使用上。部分挑战源于缺乏大量可用儿童语音数据以进行有效建模。本工作尝试在深度神经网络(DNN)框架下,利用从成人模型到儿童模型的迁移学习来解决儿童大词汇量自动语音识别(ASR)任务的关键挑战,并在多个儿童语音语料库上进行评估。本文针对既往文献中影响儿童语音识别的关键因素,对所提迁移学习技术进行了系统且广泛的分析。评估内容涵盖:(i)早期GMM-HMM与较新DNN模型的比较,(ii)标准自适应技术与迁移学习的有效性比较,(iii)应对儿童语音中存在的各类变异性的不同自适应配置,涉及(a)声谱变异性与(b)发音变异性及语言约束。我们的分析跨越:(i)DNN模型参数数量(用于自适应),(ii)自适应数据量,(iii)儿童年龄,(iv)年龄相关/无关自适应。最后,我们就(i)针对上述已分析参数的有利策略,以及(ii)基于DNN的儿童语音ASR中持续存在的潜在未来研究方向及相关挑战/问题给出了建议。

关键词

引用

@article{arxiv.1805.03322,
  title  = {Transfer Learning from Adult to Children for Speech Recognition: Evaluation, Analysis and Recommendations},
  author = {Prashanth Gurunath Shivakumar and Panayiotis Georgiou},
  journal= {arXiv preprint arXiv:1805.03322},
  year   = {2018}
}