用于语音增强的神经卡尔曼滤波
音频与语音处理
2021-04-19 v3 声音
摘要
基于统计信号处理的语音增强方法利用专家知识设计统计模型和线性滤波器,这与数据驱动的基于深度神经网络(DNN)的方法互为补充。本文通过将统计信号处理中的专家知识用于网络设计与优化,将传统卡尔曼滤波(KF)扩展到监督学习框架,并提出用于语音增强的神经卡尔曼滤波(NKF)。首先由循环神经网络(RNN)和线性维纳滤波(WF)分别产生两个中间干净语音估计,然后通过学习得到的 NKF 增益进行线性组合,得到 NKF 输出。对 NKF 采用监督联合训练,以学习在 WF 作出的瞬时线性估计与 RNN 作出的长期非线性估计之间自动权衡。NKF 方法可视为利用来自 WF 的专家知识对 RNN 估计进行正则化,从而提升其对训练中未见过噪声条件的泛化能力。在不同噪声条件下的实验表明,所提方法在客观评价指标和自动语音识别(ASR)词错误率(WERs)方面均优于基线方法。
引用
@article{arxiv.2007.13962,
title = {Neural Kalman Filtering for Speech Enhancement},
author = {Wei Xue and Gang Quan and Chao Zhang and Guohong Ding and Xiaodong He and Bowen Zhou},
journal= {arXiv preprint arXiv:2007.13962},
year = {2021}
}
备注
Submitted to ICASSP2021