中文

利用单通道语音改进多通道端到端语音识别

音频与语音处理 2021-07-07 v1

摘要

近来,神经波束形成器支持的多通道ASR的端到端训练方法已显示出其在多通道语音识别中的有效性。然而,多个模块的集成使得端到端训练更为困难,特别是在真实环境下录制且具备可观数据规模的多通道语音语料相对有限的情况下。本文探索利用单通道数据来改进多通道端到端语音识别系统。具体而言,我们设计了三种利用单通道数据的方案,即预训练、数据调度与数据仿真。在CHiME4和AISHELL-4数据集上的大量实验表明,三种方法均提升了多通道端到端训练的稳定性与语音识别性能,而数据调度方法保持了更简洁的流程(相较于预训练)并更低的的计算开销(相较于数据仿真)。此外,我们对我们的系统给出了透彻的分析,包括前端选择、数据增强、训练策略以及单通道数据规模如何影响性能。

关键词

引用

@article{arxiv.2107.02670,
  title  = {Exploiting Single-Channel Speech For Multi-channel End-to-end Speech Recognition},
  author = {Keyu An and Zhijian Ou},
  journal= {arXiv preprint arXiv:2107.02670},
  year   = {2021}
}

备注

submitted to ASRU 2021