中文

基于DNN的单麦克风多帧语音存在概率估计用于语音增强

音频与语音处理 2022-11-15 v2 声音

摘要

单麦克风语音增强的多帧方法(例如多帧最小功率无失真响应(MFMPDR)滤波器)能够利用相邻时间帧间的语音相关性。与维纳增益等单帧方法相比,研究表明只要可获得相关矩阵尤其是语音帧间相关(IFC)向量的准确估计,多帧方法就能在实现大幅噪声抑制的同时几乎不造成语音失真。IFC向量的典型估计过程需要每个时频(TF)单元中语音存在概率(SPP)的估计。本文中,我们提出使用双向长短期记忆深度神经网络(DNN)来估计每个TF单元的SPP。为实现鲁棒性能,DNN针对多种噪声类型并在大信噪比范围内进行训练。实验结果表明,结合所提数据驱动SPP估计器的MFMPDR相比最先进的基于模型的SPP估计器提升了语音质量。此外,证实在MFMPDR中利用帧间相关性相较于维纳增益尤其在不利场景下是有益的。

关键词

引用

@article{arxiv.1905.08492,
  title  = {DNN-Based Speech Presence Probability Estimation for Multi-Frame Single-Microphone Speech Enhancement},
  author = {Marvin Tammen and Dörte Fischer and Bernd T. Meyer and Simon Doclo},
  journal= {arXiv preprint arXiv:1905.08492},
  year   = {2022}
}