Fre-GAN:对抗式频率一致音频合成
音频与语音处理
2021-06-15 v2 机器学习
摘要
尽管近期神经声码器的工作已提升了合成音频的质量,但在频率空间中生成音频与真值音频之间仍存在差距。这一差异导致嘶嘶噪声或混响等频谱伪影,从而降低了采样质量。本文提出 Fre-GAN,以频率一致的方式合成音频,并大幅提升了生成质量。具体而言,我们首先提出分辨率连接生成器与分辨率判别器,帮助学习多个频带上不同尺度的频谱分布。此外,为准确重建高频成分,我们在判别器中利用离散小波变换。实验表明,Fre-GAN 实现了高保真波形生成,与真值音频的 MOS 差距仅 0.03,同时在质量上优于标准模型。
引用
@article{arxiv.2106.02297,
title = {Fre-GAN: Adversarial Frequency-consistent Audio Synthesis},
author = {Ji-Hoon Kim and Sang-Hoon Lee and Ji-Hyun Lee and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2106.02297},
year = {2021}
}
备注
Accepted paper in Interspeech 2021