中文

基于多任务联合学习方法的无线电通信语音鲁棒ASR

音频与语音处理 2021-07-23 v1 声音

摘要

为实现无线电通信条件下鲁棒的端到端自动语音识别(E2E ASR),本文提出一种基于多任务的方法,联合训练作为前端的语音增强(SE)模块与作为后端的E2E ASR模型。所提方法的优势之一在于整个系统可从头开始训练。与先前工作不同,此处任一组件都无需分别执行预训练与微调过程。经分析,我们发现所提方法的成功在于以下方面。首先,多任务学习至关重要,即SE网络不仅学习产生更智能的语音,还旨在生成有益于识别的语音。其次,我们发现从含噪语音中保留的语音相位对提升ASR性能至关重要。第三,我们提出双通道数据增强训练方法以获得进一步改进,具体而言,我们结合干净语音与增强语音来训练整个系统。我们在RATS英语数据集上评估所提方法,联合训练方法实现了4.6%的相对词错率(WER)降低,所提数据增强方法最高实现11.2%的相对词错率降低。

关键词

引用

@article{arxiv.2107.10701,
  title  = {Multitask-Based Joint Learning Approach To Robust ASR For Radio Communication Speech},
  author = {Duo Ma and Nana Hou and Van Tung Pham and Haihua Xu and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2107.10701},
  year   = {2021}
}

备注

7pages,3figures,Submitted to APSIPA2021