基于卷积神经网络图像到图像翻译的语音去削波方法
音频与语音处理
2019-10-29 v1 声音
摘要
削波作为一种当前的非线性失真,常因录音设备有限的动态范围而发生。它降低语音质量与可懂度,并对语音与说话人识别的性能产生不利影响。本文中,我们专注于使用作为 U-Net 的全卷积神经网络来增强削波语音。受图像到图像翻译思想的启发,我们提出一种去削波方法,即 U-Net 去削波器,其中将削波信号的幅度谱图像翻译为干净信号的对应图像。实验结果表明,所提方法在质量和可懂度度量上均优于其他去削波方法,尤其在严重削波情况下。此外,在加性高斯噪声条件下,U-Net 去削波器相对于知名去削波方法的优越性能得到验证。
引用
@article{arxiv.1910.12116,
title = {Image to Image Translation based on Convolutional Neural Network Approach for Speech Declipping},
author = {Hamidreza Baradaran Kashani and Ata Jodeiri and Mohammad Mohsen Goodarzi and Shabnam Gholamdokht Firooz},
journal= {arXiv preprint arXiv:1910.12116},
year = {2019}
}
备注
Accepted at 4th Conference on Technology In Electrical and Computer Engineering (ETECH 2019)