中文

面向小读者语音音子识别的端到端声学建模

音频与语音处理 2021-03-05 v1 声音

摘要

在性能竞争中,儿童语音的自动识别系统落后于专用于成人语音的系统。该现象源于儿童身体发育导致的儿童语音中较高的声学与语言变异性,以及可用儿童语音数据的缺乏。小读者语音还表现出朗读速率慢和存在阅读错误等特性,使任务更加困难。本工作试图在有限数据下解决小龄儿童语音音子声学建模的主要挑战,并增进对多种模型架构在该领域优势与不足的理解。我们发现迁移学习技术在端到端架构上对于以少量儿童语音数据实现成人到儿童适配极为有效。通过迁移学习,一个辅以连接主义时序分类(CTC)目标函数的 Transformer 模型达到了 28.1% 的音子错误率,相对优于最先进的 DNN-HMM 模型 6.6%,并相对优于其他端到端架构 8.5% 以上。我们给出了模型在两个特定阅读任务(孤立词与句子)上表现的分析,显示了语句长度对基于注意力和基于 CTC 模型的影响。Transformer+CTC 模型展现出更好检测儿童阅读错误的能力,这可归因于 CTC 目标函数有效地约束注意力机制保持单调。

关键词

引用

@article{arxiv.2103.02899,
  title  = {End-to-end acoustic modelling for phone recognition of young readers},
  author = {Lucile Gelin and Morgane Daniel and Julien Pinquier and Thomas Pellegrini},
  journal= {arXiv preprint arXiv:2103.02899},
  year   = {2021}
}

备注

16 pages, 8 figures