利用非母语儿童未转写数据实现低资源德语ASR——INTERSPEECH 2021共享任务SPAPL系统
音频与语音处理
2021-06-21 v1 机器学习
摘要
本文描述了用于INTERSPEECH 2021挑战赛的SPAPL系统:非母语儿童德语语音识别共享任务。提供约5小时转写数据和约60小时未转写数据以开发面向儿童的德语ASR系统。对于转写数据的训练,我们提出非语音状态判别损失(NSDL)以减轻语音语句内长时非语音段的影响。为探索未转写数据的使用,我们实现并组合多种方法以逐步提升系统性能。首先,使用双向自回归预测编码(Bi-APC)利用所提供的未转写数据学习声学建模的初始参数。其次,进一步使用增量半监督学习迭代生成伪转写数据。第三,在不同训练阶段使用不同数据增强方案以增加训练数据的多样性和规模。最后,使用循环神经网络语言模型(RNNLM)进行重打分。我们的系统在评测数据上取得了39.68%的词错误率(WER),相对官方基线(45.21%)约有12%的相对提升。
引用
@article{arxiv.2106.09963,
title = {Low Resource German ASR with Untranscribed Data Spoken by Non-native Children -- INTERSPEECH 2021 Shared Task SPAPL System},
author = {Jinhan Wang and Yunzheng Zhu and Ruchao Fan and Wei Chu and Abeer Alwan},
journal= {arXiv preprint arXiv:2106.09963},
year = {2021}
}
备注
Accepted to INTERSPEECH 2021