基于多任务联合学习方法的无线电通信语音鲁棒ASR
音频与语音处理
2021-07-23 v1 声音
摘要
为实现无线电通信条件下鲁棒的端到端自动语音识别(E2E ASR),本文提出一种基于多任务的方法,联合训练作为前端的语音增强(SE)模块与作为后端的E2E ASR模型。所提方法的优势之一在于整个系统可从头开始训练。与先前工作不同,此处任一组件都无需分别执行预训练与微调过程。经分析,我们发现所提方法的成功在于以下方面。首先,多任务学习至关重要,即SE网络不仅学习产生更智能的语音,还旨在生成有益于识别的语音。其次,我们发现从含噪语音中保留的语音相位对提升ASR性能至关重要。第三,我们提出双通道数据增强训练方法以获得进一步改进,具体而言,我们结合干净语音与增强语音来训练整个系统。我们在RATS英语数据集上评估所提方法,联合训练方法实现了4.6%的相对词错率(WER)降低,所提数据增强方法最高实现11.2%的相对词错率降低。
引用
@article{arxiv.2107.10701,
title = {Multitask-Based Joint Learning Approach To Robust ASR For Radio Communication Speech},
author = {Duo Ma and Nana Hou and Van Tung Pham and Haihua Xu and Eng Siong Chng},
journal= {arXiv preprint arXiv:2107.10701},
year = {2021}
}
备注
7pages,3figures,Submitted to APSIPA2021