基于短时离散余弦变换的实时单通道语音增强
音频与语音处理
2021-02-10 v1 声音
摘要
基于深度学习的语音增强算法在语音可懂度和感知质量方面已有极大提升。许多方法侧重于增强幅度谱,同时利用混合相位重建语音。由于干净相位非常重要且难以预测,这些方法的性能将受限。一些研究者尝试直接 or 间接估计相位谱,但效果不理想。近来,一些研究提出了复值模型并取得了最先进的性能,例如深度复数卷积循环网络(DCCRN)。然而,该模型的计算量巨大。为降低复杂度并进一步提升性能,我们在本文中提出一种以离散余弦变换作为输入的新方法,称为深度余弦变换卷积循环网络(DCTCRN)。实验结果表明,DCTCRN 在客观和主观指标上均取得了最先进的性能。与带噪混合相比,所提模型处理的平均意见得分(MOS)绝对提升了 0.46(从 2.86 升至 3.32),且仅含 2.86M 参数。
引用
@article{arxiv.2102.04629,
title = {Real-time Monaural Speech Enhancement With Short-time Discrete Cosine Transform},
author = {Qinglong Li and Fei Gao and Haixin Guan and Kaichi Ma},
journal= {arXiv preprint arXiv:2102.04629},
year = {2021}
}
备注
5 pages, 2 figures, Journal submitted