中文

基于广义主成分的语音增强瞬时 PSD 估计

音频与语音处理 2022-11-21 v1 声音

摘要

各类麦克风信号分量的功率谱密度(PSD)估计对许多语音增强过程至关重要。由于语音具有高度非平稳性,保持 PSD 估计中的时变特性可带来性能提升。本文提出一种基于广义主成分的瞬时 PSD 估计方法。与其他基于特征空间的 PSD 估计方法类似,我们依赖递归平均以获得待分解的麦克风信号相关矩阵估计。然而,我们并非直接由该矩阵随时间平滑的广义特征值估计 PSD(从而得到时间平滑的 PSD 估计),而是提出由新定义的瞬时广义特征值估计 PSD,从而得到瞬时 PSD 估计。瞬时广义特征值由广义主成分定义,即麦克风信号的一种基于广义特征向量的变换。我们进一步表明,平滑广义特征值可理解为瞬时广义特征值的递归平均。比较采用平滑与瞬时 PSD 估计的多通道维纳滤波器(MWF)的仿真结果表明,后者具有更优的语音增强性能。MATLAB 实现已在线提供。

关键词

引用

@article{arxiv.2007.00542,
  title  = {Instantaneous PSD Estimation for Speech Enhancement based on Generalized Principal Components},
  author = {Thomas Dietzen and Marc Moonen and Toon van Waterschoot},
  journal= {arXiv preprint arXiv:2007.00542},
  year   = {2022}
}