中文

NTNU系统在Interspeech 2020非母语儿童语音ASR挑战赛中的表现

音频与语音处理 2020-06-04 v2 计算与语言 声音

摘要

本文描述了挪威科技大学(NTNU)参与由ISCA的SIG-CHILD小组支持的Interspeech 2020非母语儿童语音ASR挑战赛的ASR系统。由于非母语与儿童说话特征同时存在多样性,该ASR共享任务更具挑战性。在闭轨评估设定下,所有参与者被限制仅能基于组织者提供的语音和文本语料库开发其系统。为应对这一资源不足问题,我们在基于CNN-TDNNF的声学模型之上构建ASR系统,同时利用多种数据增强策略的协同能力,包括语句级和词级速度扰动以及谱图增强,并结合一种简单而有效的数据清洗方法。我们所有变体的ASR系统均采用基于RNN的语言模型对第一遍识别假设进行重打分,该语言模型仅使用组织者发布的文本数据集训练。我们配置最佳的系统的WER(词错误率)为17.59%,获得第二名,而性能最佳、季军及官方基线系统的WER分别为15.67%、18.71%、35.09%。

关键词

引用

@article{arxiv.2005.08433,
  title  = {The NTNU System at the Interspeech 2020 Non-Native Children's Speech ASR Challenge},
  author = {Tien-Hong Lo and Fu-An Chao and Shi-Yan Weng and Berlin Chen},
  journal= {arXiv preprint arXiv:2005.08433},
  year   = {2020}
}

备注

Submitted to Interspeech 2020 Special Session: Shared Task on Automatic Speech Recognition for Non-Native Children's Speech