HooliGAN:鲁棒、高质量的神经声码器
音频与语音处理
2020-08-07 v1 声音
摘要
生成模型的最新进展表明,深度学习与传统数字信号处理(DSP)技术相结合可成功生成逼真的 violin 样本[1],源激励与 WaveNet 结合可产生高质量声码器[2, 3],且生成对抗网络(GAN)训练可提升自然度[4, 5]。结合这些模型中的思想,我们引入 HooliGAN,一种鲁棒的声码器,其具有最先进的结果,能很好地微调至较小数据集(<30 分钟语音数据),并在 GPU 上以 2.2MHz、CPU 上以 35kHz 生成音频。我们还展示了对基于 Tacotron 的模型的简单修改,使其能与 HooliGAN 无缝集成。听感测试结果表明,所提模型能够持续输出高质量音频,且适用于各种大小数据集。我们在以下演示页提供样本:https://resemble-ai.github.io/hooligan_demo/
引用
@article{arxiv.2008.02493,
title = {HooliGAN: Robust, High Quality Neural Vocoding},
author = {Ollie McCarthy and Zohaib Ahmed},
journal= {arXiv preprint arXiv:2008.02493},
year = {2020}
}