中文

通过特征学习与端到端训练实现空中交通管制语音识别

声音 2021-11-05 v1 计算与语言 音频与语音处理

摘要

在这项工作中,我们提出了一种基于特征学习和端到端训练过程的空中交通管制(ATC)系统自动语音识别(ASR)新系统。所提出的模型集成了特征学习模块、循环神经网络(RNN)和连接时序分类损失,以构建端到端 ASR 模型。面对 ATC 语音的复杂环境,我们设计了学习模块来从原始波形中提取信息特征用于声学建模,而非人工设计的特征。我们应用 SincNet 和一维卷积模块来处理原始波形,其输出被拼接至 RNN 层以进行时间建模。得益于从原始波形中学习表示的能力,所提出的模型可以以完全端到端的方式进行优化,即从波形到文本。最后,还考虑了 ATC 领域的多语言问题,通过构建汉字和英文字母的组合词汇表来实现 ASR 任务。所提出的方法在多语言真实世界语料库(ATCSpeech)上得到了验证,实验结果表明所提出的方法优于其他基线,实现了 6.9% 的字符错误率。

关键词

引用

@article{arxiv.2111.02654,
  title  = {Speech recognition for air traffic control via feature learning and end-to-end training},
  author = {Peng Fan and Dongyue Guo and Yi Lin and Bo Yang and Jianwei Zhang},
  journal= {arXiv preprint arXiv:2111.02654},
  year   = {2021}
}

备注

Submitted to IEEE ICASSP 2022