基于深度频谱图像翻译网络的语音增强
音频与语音处理
2019-11-06 v1 声音
摘要
在加性背景噪声下,语音信号的质量和可懂度会下降,这是助听器和人工耳蜗用户面临的一个关键问题。为解决该问题,我们提出了一种使用深度频谱图像翻译网络的新型语音增强方法。为此,我们提出了一种称为 VGG19-UNet 的新架构,其中将一个称为 VGG19 的深度全卷积网络嵌入到图像到图像翻译网络即 U-Net 的编码器部分。此外,我们提出了一种感知修正版的频谱图像,其表示在梅尔频率和幂律非线性幅度域中,可良好近似人类听觉感知模型。通过在语音增强中的真实挑战(即未见噪声环境)上进行实验,我们表明所提方法在由 PESQ 和 ESTOI 分别表示的质量和可懂度度量上均优于其他增强方法。
引用
@article{arxiv.1911.01902,
title = {Speech Enhancement via Deep Spectrum Image Translation Network},
author = {Hamidreza Baradaran Kashani and Ata Jodeiri and Mohammad Mohsen Goodarzi and Iman Sarraf Rezaei},
journal= {arXiv preprint arXiv:1911.01902},
year = {2019}
}
备注
Accepted at ICBME 2019