面向儿童语音识别的数据增强——SLT 2021 儿童语音识别挑战赛的“Ethiopian”系统
声音
2020-11-10 v1 音频与语音处理
摘要
本文介绍了用于 SLT 2021 儿童语音识别挑战赛的“Ethiopian”系统。针对儿童语音识别问题,特别是儿童语音识别训练数据匮乏的问题,提出了多种数据处理与增强技术。我们设计并开展了详尽的实验,以在不同语音识别工具包与模型架构下展示各项技术的有效性。我们逐步说明了最终系统的构建过程,该系统在 SLT 2021 儿童语音识别挑战赛中取得了最先进的结果:在 Track 1 评测集上 CER 为 21.66%(总排名第四),在 Track 2 评测集上 CER 为 16.53%(总排名第一)。赛后分析表明,我们的系统在 Track 1 评测集上的实际 CER 为 18.82%,但我们在 Track 1 向挑战赛组织者提交了错误版本。
引用
@article{arxiv.2011.04547,
title = {Data Augmentation For Children's Speech Recognition -- The "Ethiopian" System For The SLT 2021 Children Speech Recognition Challenge},
author = {Guoguo Chen and Xingyu Na and Yongqing Wang and Zhiyong Yan and Junbo Zhang and Sifan Ma and Yujun Wang},
journal= {arXiv preprint arXiv:2011.04547},
year = {2020}
}
备注
System description of the SLT 2021 Children Speech Recognition Challenge