使用深度复数Unet的多通道自动语音识别
声音
2020-11-19 v1 音频与语音处理
摘要
多通道自动语音识别(ASR)系统中的前端模块主要利用麦克风阵列技术,在含混响与回声的噪声条件下产生增强信号。近来,基于神经网络(NN)的前端相较传统信号处理方法展现出可观改进。本文提出采用深度复数Unet(DCUnet,一种强大的复数值Unet结构语音增强模型)作为多通道声学模型的前端,并将其与级联框架进行比较,集成于多任务学习(MTL)框架中。同时,我们以若干训练策略考察所提方法,以提升在带回声的1000小时真实世界小米智能音箱数据上的识别准确率。实验表明,相较传统阵列处理加单通道声学模型方法,我们提出的DCUnet-MTL方法带来了约12.2%的相对字符错误率(CER)降低,并且优于近期提出的神经波束成形方法。
引用
@article{arxiv.2011.09081,
title = {Multi-Channel Automatic Speech Recognition Using Deep Complex Unet},
author = {Yuxiang Kong and Jian Wu and Quandong Wang and Peng Gao and Weiji Zhuang and Yujun Wang and Lei Xie},
journal= {arXiv preprint arXiv:2011.09081},
year = {2020}
}
备注
7 pages, 4 figures, IEEE SLT 2021 Technical Committee