面向语音增强的多目标学习掩码融合
音频与语音处理
2021-09-29 v2
摘要
近年来,基于深度神经网络(DNN)的时频(T-F)掩码估计在语音增强中表现出显著的有效性。通常,首先基于 DNN 估计单个 T-F 掩码,然后用于掩蔽带噪语音的谱图以抑制噪声。本工作提出一种用于语音增强的多掩码融合方法。它同时估计两个互补的掩码,例如理想比率掩码(IRM)和目标二值掩码(TBM),然后将它们融合以获得用于语音增强的精炼掩码。新方法的优势有两点。首先,同时估计多个互补掩码带来了多目标学习赋予的收益。其次,多掩码融合可利用多个掩码的互补性来提升语音增强性能。实验结果表明,所提方法相比传统基于掩码的方法能实现显著的 PESQ 提升并降低后端识别错误率。代码见 https://github.com/lc-zhou/mask-fusion。
引用
@article{arxiv.2109.11164,
title = {Masks Fusion with Multi-Target Learning For Speech Enhancement},
author = {Liangchen Zhou and Wenbin Jiang and Jingyan Xu and Fei Wen and Peilin Liu},
journal= {arXiv preprint arXiv:2109.11164},
year = {2021}
}