HiFi-SR:一种用于高保真语音超分辨率的统一生成式 Transformer-卷积对抗网络
声音
2025-01-20 v1 音频与语音处理
摘要
生成对抗网络(GAN)的应用近期推动了基于中间表示(如梅尔频谱)的语音超分辨率(SR)技术发展。然而,依赖于独立训练的拼接式网络的现有 SR 方法可能导致表征不一致并产生差异的语音质量,尤其在域外场景下更为明显。本文提出 HiFi-SR,一种统一网络,利用端到端对抗训练实现高保真语音超分辨率。该模型具备统一的 Transformer-卷积生成器,能无缝处理潜在表征的预测及其转换为时域波形的转换。Transformer 网络作为强大的编码器,将低分辨率梅尔频谱转换为潜在空间表征,而卷积网络则将这些表征上采样为高分辨率波形。为提升高频保真度,我们引入多带、多尺度时频判别器,并在对抗训练过程中加入多尺度梅尔重构损失。HiFi-SR 具有高度灵活性,可将输入语音信号在 4 kHz至 32 kHz 范围内上采样至 48 kHz 采样率。实验结果表明,HiFi-SR 在客观指标和 ABX 偏好测试中均显著优于现有语音 SR 方法,无论是域内还是域外场景(https://github.com/modelscope/ClearerVoice-Studio)。
引用
@article{arxiv.2501.10045,
title = {HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution},
author = {Shengkui Zhao and Kun Zhou and Zexu Pan and Yukun Ma and Chong Zhang and Bin Ma},
journal= {arXiv preprint arXiv:2501.10045},
year = {2025}
}
备注
5 pages, 5 figures, accepted by ICASSP 2025