中文

基于块在线 FastMNMF 驱动帧在线波束赋形的无 DNN 低延迟自适应语音增强

音频与语音处理 2022-07-25 v1 声音

摘要

本文描述了一个实用的双过程语音增强系统,其借助与环境无关块在线源分离(后端)来适配对环境敏感的帧在线波束赋形(前端)。在使用最小方差无失真响应(MVDR)波束赋形时,可训练深度神经网络(DNN)估计用于计算源(语音与噪声)协方差矩阵的时频掩码。为处理训练-测试条件失配,已有基于反向传播的 DNN 运行时自适应方案。作为替代,可尝试用一种称为快速多通道非负矩阵分解(FastMNMF)的先进盲源分离方法直接估计源协方差矩阵。然而实践中,无论 DNN 还是 FastMNMF 均因其计算昂贵的迭代特性而无法以帧在线方式更新。我们的无 DNN 系统利用块在线 FastMNMF 给出的最新源谱图后验,推导当前源协方差矩阵以用于帧在线波束赋形。评估表明,我们的帧在线系统能快速响应由干扰说话人移动引起的场景变化,并在词错误率上以 5.0 个点优于现有的基于 DNN 波束赋形的块在线系统。

关键词

引用

@article{arxiv.2207.10934,
  title  = {DNN-Free Low-Latency Adaptive Speech Enhancement Based on Frame-Online Beamforming Powered by Block-Online FastMNMF},
  author = {Aditya Arie Nugraha and Kouhei Sekiguchi and Mathieu Fontaine and Yoshiaki Bando and Kazuyoshi Yoshii},
  journal= {arXiv preprint arXiv:2207.10934},
  year   = {2022}
}

备注

IWAENC 2022