基于彩色谱图的单通道语音增强
音频与语音处理
2023-10-27 v1 声音
摘要
语音增强涉及从目标语音中去除不需要的背景声音以改善其质量和可懂度的必要处理过程。本文提出一种利用彩色谱图的单通道语音增强新方法。我们建议使用改编自 pix2pix 生成对抗网络(GAN)的深度神经网络(DNN)架构,并在语音的彩色谱图上训练以对其进行去噪。去噪后,使用浅层回归神经网络将谱图的颜色转换为短时傅里叶变换(STFT)的幅度。这些估计的 STFT 幅度随后与含噪相位结合以获得增强语音。结果显示,相较于未处理的含噪数据,感知语音质量评估(PESQ)提升了近 0.84 分,短时客观可懂度(STOI)提升了 1%。相较于未处理信号在质量和可懂度上的增益,几乎等同于用于与所提模型比较的基线方法所取得的增益,但计算成本大幅降低。所提方案在 PESQ 分数上可与基于灰度谱图训练、取得最高 PESQ 分数的相似基线模型相媲美,而计算成本降低近 10 倍;与另一基于卷积神经网络-GAN(CNN-GAN)、生成最可懂语音的基线系统相比,STOI 仅低 1%,而计算成本降低 28 倍。
引用
@article{arxiv.2310.17142,
title = {Single channel speech enhancement by colored spectrograms},
author = {Sania Gul and Muhammad Salman Khan and Muhammad Fazeel},
journal= {arXiv preprint arXiv:2310.17142},
year = {2023}
}
备注
18 pages, 6 figures, 5 tables