中文

Source-Filter HiFi-GAN:快速且音高可控的高保真神经声码器

声音 2023-02-28 v3 机器学习 音频与语音处理

摘要

我们之前的工作,统一源-滤波器 GAN(uSFGAN)声码器,将基于源-滤波器理论的新颖架构引入并行波形生成对抗网络,以实现高语音质量和音高可控性。然而,高时间分辨率输入导致高计算成本。尽管 HiFi-GAN 声码器凭借高效的基于上采样的生成器架构实现了快速高保真语音生成,但其音高可控性受到严重限制。为实现快速且音高可控的高保真神经声码器,我们将源-滤波器理论引入 HiFi-GAN,通过以良好估计的源激励信息分层条件化共振滤波网络。根据实验结果,我们提出的方法在歌声生成上的语音质量和单 CPU 合成速度均优于 HiFi-GAN 和 uSFGAN。此外,与 uSFGAN 声码器不同,所提方法可轻松采用/集成于实时应用和端到端系统中。

关键词

引用

@article{arxiv.2210.15533,
  title  = {Source-Filter HiFi-GAN: Fast and Pitch Controllable High-Fidelity Neural Vocoder},
  author = {Reo Yoneyama and Yi-Chiao Wu and Tomoki Toda},
  journal= {arXiv preprint arXiv:2210.15533},
  year   = {2023}
}

备注

Accepted to ICASSP 2023