中文

LeVoice 用于 ISCSLP 2022 智能座舱语音识别挑战赛的 ASR 系统

音频与语音处理 2022-10-18 v2 声音

摘要

本文描述了 LeVoice 自动语音识别系统参与 2022 年智能座舱语音识别挑战赛 track2 的情况。track2 是一项对模型规模无限制的语音识别任务。我们的主要工作包括基于深度学习的语音增强、基于文本转语音的语音生成、通过多种技术进行训练数据增强以及语音识别模型融合。我们比较并融合了混合架构与两类端到端架构。对于端到端建模,我们使用了基于连接主义时序分类/基于注意力的编码器-解码器架构和循环神经网络转导器/基于注意力的编码器-解码器架构的模型。这些模型的性能通过使用额外的语言模型进行评估以降低词错误率。最终,我们的系统在挑战赛测试集数据上取得了 10.2% 的字错误率,并在提交的系统中排名第三。

关键词

引用

@article{arxiv.2210.07749,
  title  = {LeVoice ASR Systems for the ISCSLP 2022 Intelligent Cockpit Speech Recognition Challenge},
  author = {Yan Jia and Mi Hong and Jingyu Hou and Kailong Ren and Sifan Ma and Jin Wang and Fangzhen Peng and Yinglin Ji and Lin Yang and Junjie Wang},
  journal= {arXiv preprint arXiv:2210.07749},
  year   = {2022}
}

备注

There are experimental errors