中文

使用深度复数Unet的多通道自动语音识别

声音 2020-11-19 v1 音频与语音处理

摘要

多通道自动语音识别(ASR)系统中的前端模块主要利用麦克风阵列技术,在含混响与回声的噪声条件下产生增强信号。近来,基于神经网络(NN)的前端相较传统信号处理方法展现出可观改进。本文提出采用深度复数Unet(DCUnet,一种强大的复数值Unet结构语音增强模型)作为多通道声学模型的前端,并将其与级联框架进行比较,集成于多任务学习(MTL)框架中。同时,我们以若干训练策略考察所提方法,以提升在带回声的1000小时真实世界小米智能音箱数据上的识别准确率。实验表明,相较传统阵列处理加单通道声学模型方法,我们提出的DCUnet-MTL方法带来了约12.2%的相对字符错误率(CER)降低,并且优于近期提出的神经波束成形方法。

关键词

引用

@article{arxiv.2011.09081,
  title  = {Multi-Channel Automatic Speech Recognition Using Deep Complex Unet},
  author = {Yuxiang Kong and Jian Wu and Quandong Wang and Peng Gao and Weiji Zhuang and Yujun Wang and Lei Xie},
  journal= {arXiv preprint arXiv:2011.09081},
  year   = {2020}
}

备注

7 pages, 4 figures, IEEE SLT 2021 Technical Committee