mdctGAN:基于改进离散余弦变换谱以驯服Transformer式GAN的语音超分辨率方法
音频与语音处理
2023-05-22 v2 人工智能
摘要
语音超分辨率(SSR)旨在从其对应的低分辨率(LR)语音恢复高分辨率(HR)语音。近期 SSR 方法更多关注幅度谱图的重建,忽视了相位重建的重要性,从而限制了恢复质量。为解决此问题,我们提出 mdctGAN,一种基于改进离散余弦变换(MDCT)的新型 SSR 框架。通过在 MDCT 域进行对抗学习,我们的方法以相位感知方式重建 HR 语音,无需声码器或额外后处理。此外,通过自注意力机制学习频率一致特征,mdctGAN 保证了高质量的语音重建。在 VCTK 语料数据集上,实验结果表明我们的模型生成了具有自然听觉质量的高 MOS 与 PESQ 分数语音。在从多种输入采样率到 48 kHz 目标分辨率的任务上,它也取得了最先进的 log-spectral-distance(LSD)性能。代码可从 https://github.com/neoncloud/mdctGAN 获取。
引用
@article{arxiv.2305.11104,
title = {mdctGAN: Taming transformer-based GAN for speech super-resolution with Modified DCT spectra},
author = {Chenhao Shuai and Chaohua Shi and Lu Gan and Hongqing Liu},
journal= {arXiv preprint arXiv:2305.11104},
year = {2023}
}
备注
5 pages, 4 figures, INTERSPEECH 2023