一种具有有效频谱压缩映射的两阶段全频带语音增强模型
声音
2022-06-28 v1 音频与语音处理
摘要
基于深度神经网络(DNN)的宽带语音增强(SE)直接扩展到全频带处理面临低频段频率分辨率低的挑战,这极有可能导致模型性能下降。本文提出一种可学习的频谱压缩映射(SCM),以有效压缩高频分量,从而使其能以更高效的方式被处理。通过这种方式,模型可以更多地关注低频和中频范围,而语音能量大多集中于此。我们并非在单一网络结构中抑制噪声,而是先估计频谱幅度掩码,将语音转换到高信噪比(SNR)状态,然后利用后续模型进一步优化预增强信号的实部与虚部掩码。我们进行了全面的实验以验证所提方法的有效性。
引用
@article{arxiv.2206.13136,
title = {A two-stage full-band speech enhancement model with effective spectral compression mapping},
author = {Zhongshu Hou and Qinwen Hu and Kai Chen and Jing Lu},
journal= {arXiv preprint arXiv:2206.13136},
year = {2022}
}