LeVoice 用于 ISCSLP 2022 智能座舱语音识别挑战赛的 ASR 系统
音频与语音处理
2022-10-18 v2 声音
摘要
本文描述了 LeVoice 自动语音识别系统参与 2022 年智能座舱语音识别挑战赛 track2 的情况。track2 是一项对模型规模无限制的语音识别任务。我们的主要工作包括基于深度学习的语音增强、基于文本转语音的语音生成、通过多种技术进行训练数据增强以及语音识别模型融合。我们比较并融合了混合架构与两类端到端架构。对于端到端建模,我们使用了基于连接主义时序分类/基于注意力的编码器-解码器架构和循环神经网络转导器/基于注意力的编码器-解码器架构的模型。这些模型的性能通过使用额外的语言模型进行评估以降低词错误率。最终,我们的系统在挑战赛测试集数据上取得了 10.2% 的字错误率,并在提交的系统中排名第三。
引用
@article{arxiv.2210.07749,
title = {LeVoice ASR Systems for the ISCSLP 2022 Intelligent Cockpit Speech Recognition Challenge},
author = {Yan Jia and Mi Hong and Jingyu Hou and Kailong Ren and Sifan Ma and Jin Wang and Fangzhen Peng and Yinglin Ji and Lin Yang and Junjie Wang},
journal= {arXiv preprint arXiv:2210.07749},
year = {2022}
}
备注
There are experimental errors