中文

利用非平稳性与稀疏性并结合空间约束ICA的统计波束形成器用于鲁棒语音识别

音频与语音处理 2024-01-08 v3 声音

摘要

本文提出一种统计波束形成算法,作为鲁棒自动语音识别(ASR)的预处理步骤。通过将目标语音建模为非平稳拉普拉斯分布,提出一种基于掩码的统计波束形成算法,利用其输出与掩码输入方差来鲁棒估计波束形成器。此外,我们还提出一种基于独立分量分析(ICA)中由目标与噪声输出所得噪声功率比的导向矢量估计(SVE)方法。为在同一ICA框架中更新波束形成器,我们推导了带目标语音无失真与零约束的ICA,分别在目标输出产生波束形成语音、在其他输出产生噪声。目标输出的解混权重得到一种使用由源模型表征的加权函数的加权空间协方差矩阵(wSCM)统计波束形成器。为增强SVE,由拉格朗日乘子法施加的严格零约束通过带权重参数的广义惩罚放宽,同时维持严格无失真约束。此外,我们基于递推最小二乘(RLS)优化技术推导了用于实际应用的在线算法。在CHiME-4与LibriCSS数据集多种环境下的实验结果表明,相较于基于ICA的传统波束形成与盲源提取(BSE),所提算法在批处理与在线处理上均有效。

关键词

引用

@article{arxiv.2306.07562,
  title  = {Statistical Beamformer Exploiting Non-stationarity and Sparsity with Spatially Constrained ICA for Robust Speech Recognition},
  author = {Ui-Hyeop Shin and Hyung-Min Park},
  journal= {arXiv preprint arXiv:2306.07562},
  year   = {2024}
}

备注

Accepted by TASLP