中文

Fre-GAN:对抗式频率一致音频合成

音频与语音处理 2021-06-15 v2 机器学习

摘要

尽管近期神经声码器的工作已提升了合成音频的质量,但在频率空间中生成音频与真值音频之间仍存在差距。这一差异导致嘶嘶噪声或混响等频谱伪影,从而降低了采样质量。本文提出 Fre-GAN,以频率一致的方式合成音频,并大幅提升了生成质量。具体而言,我们首先提出分辨率连接生成器与分辨率判别器,帮助学习多个频带上不同尺度的频谱分布。此外,为准确重建高频成分,我们在判别器中利用离散小波变换。实验表明,Fre-GAN 实现了高保真波形生成,与真值音频的 MOS 差距仅 0.03,同时在质量上优于标准模型。

关键词

引用

@article{arxiv.2106.02297,
  title  = {Fre-GAN: Adversarial Frequency-consistent Audio Synthesis},
  author = {Ji-Hoon Kim and Sang-Hoon Lee and Ji-Hyun Lee and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2106.02297},
  year   = {2021}
}

备注

Accepted paper in Interspeech 2021