HiFi-GAN:用于高效高保真语音合成的生成对抗网络
声音
2020-10-26 v2 机器学习
音频与语音处理
摘要
近期若干语音合成工作采用生成对抗网络 (GANs) 生成原始波形。尽管此类方法改善了采样效率与内存占用,其样本质量尚未达到自回归与基于流的生成模型。本文提出 HiFi-GAN,实现了高效且高保真的语音合成。由于语音音频由具有不同周期的正弦信号组成,我们证明对音频周期模式建模对提升样本质量至关重要。在单说话人数据集上的主观人工评测 (平均意见分, MOS) 表明,所提方法在生成 22.05 kHz 高保真音频时表现出与人类质量相近的相似度,且在单块 V100 GPU 上比实时快 167.9 倍。我们进一步展示了 HiFi-GAN 对未见说话人的梅尔谱图反演及端到端语音合成的通用性。最后,HiFi-GAN 的小足迹版本在 CPU 上以可比于自回归对应模型的品质实现比实时快 13.4 倍的采样。
引用
@article{arxiv.2010.05646,
title = {HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis},
author = {Jungil Kong and Jaehyeon Kim and Jaekyoung Bae},
journal= {arXiv preprint arXiv:2010.05646},
year = {2020}
}
备注
NeurIPS 2020. Code available at https://github.com/jik876/hifi-gan