用于噪声环境下语音识别的秩1约束多通道维纳滤波器
声音
2017-11-16 v2 计算与语言
摘要
多通道线性滤波器,如多通道维纳滤波器(MWF)和广义特征值(GEV)波束成形器,是流行的信号处理技术,可改善语音识别性能。本文在特定语音识别任务(即具有多噪声环境真实录音的 CHiME-4 挑战赛)上对这些线性滤波器进行了实验研究。具体地,采用秩1 MWF 进行噪声抑制,并推导出一种增强识别性能的新常数残余噪声功率约束。为满足潜在的秩1假设,基于特征向量或广义特征向量重构语音协方差矩阵。随后,在同一框架(涉及用于掩码估计的双向长短期记忆(BLSTM)网络)下,将秩1约束 MWF 与其他多通道线性滤波器进行评估。所提滤波器优于其他滤波器,在真实测试集上相较基线加权延迟求和(WDAS)波束成形器实现了 40% 的相对词错误率(WER)降低,相较 GEV-BAN 方法实现了 15% 的相对 WER 降低。结果还表明,语音识别准确率与梅尔频率倒谱系数(MFCC)特征方差的相关性,强于其与噪声抑制或语音失真程度的相关性。
引用
@article{arxiv.1707.00201,
title = {Rank-1 Constrained Multichannel Wiener Filter for Speech Recognition in Noisy Environments},
author = {Ziteng Wang and Emmanuel Vincent and Romain Serizel and Yonghong Yan},
journal= {arXiv preprint arXiv:1707.00201},
year = {2017}
}
备注
for Computer Speech and Language