用于基于广义特征值波束形成的ASR的无监督神经掩码估计器
音频与语音处理
2019-12-02 v1 机器学习
声音
信号处理
摘要
多通道ASR中声学波束形成的先进方法基于一个神经掩码估计器,该估计器预测语音与噪声的存在。这些模型使用干净与含噪录音的配对语料库(教师模型)进行训练。本文中,我们试图摆脱训练掩码估计器需要监督干净录音的要求。基于信号增强与使用多通道线性预测的波束形成所得的模型充当所需的掩码估计。以此方式,模型训练也可在真实含噪语音录音上进行,而非典型教师模型中仅有的模拟数据。在CHiME-3语料库与REVERB挑战赛语料库的含噪与混响环境下进行的若干实验凸显了所提方法的有效性。所提方法的ASR结果显著优于在域外数据集上训练的教师模型,并与在域内数据集上训练的神谕掩码估计器表现相当。
引用
@article{arxiv.1911.12617,
title = {Unsupervised Neural Mask Estimator For Generalized Eigen-Value Beamforming Based ASR},
author = {Rohit Kumar and Anirudh Sreeram and Anurenjan Purushothaman and Sriram Ganapathy},
journal= {arXiv preprint arXiv:1911.12617},
year = {2019}
}