中文

利用韵律与错误开始进行数据增强以识别非母语儿童语音

音频与语音处理 2020-09-01 v1 计算与语言

摘要

本文描述了 AaltoASR 针对 INTERSPEECH 2020 关于非母语儿童语音自动语音识别 (ASR) 共享任务的语音识别系统。该任务是在给定有限语音量的条件下,识别来自不同年龄组儿童的非母语语音。此外,语音为自发语音,含有被转写为部分词的错误开始,这在测试转写中导致了未出现过的部分词。为应对这两大挑战,我们研究了一种基于数据增强的方法。首先,我们应用基于韵律的数据增强来补充音频数据。其次,我们通过在语言建模语料中引入部分词噪声来模拟错误开始,从而创建新词。在基于韵律的增强数据上训练的声学模型优于使用基线方案或基于 SpecAugment 的增强的模型。部分词噪声也有助于改进基线语言模型。我们结合这些方案的 ASR 系统在评测阶段排名第三,词错误率达到 18.71%。在评测后阶段,我们观察到增加基于韵律的增强数据量可带来更好的性能。此外,从假设中移除低置信度得分词可带来进一步的提升。这两项改进将 ASR 错误率降低至 17.99%。

关键词

引用

@article{arxiv.2008.12914,
  title  = {Data augmentation using prosody and false starts to recognize non-native children's speech},
  author = {Hemant Kathania and Mittul Singh and Tamás Grósz and Mikko Kurimo},
  journal= {arXiv preprint arXiv:2008.12914},
  year   = {2020}
}