中文

InstructSing: 通过自我指示实现高保真唱声生成

音频与语音处理 2024-09-11 v1 声音

摘要

在确保高质量生成语音且推理速度可接受的前提下,加速训练过程具有挑战。本文提出一种新型神经声码器称为 InstructSing,能够在保持良好性能的同时显著加快收敛速度,通过集成可微分的数字信号处理和对抗训练。它包含一个生成器和两个判别器。具体而言,生成器包含一个谐波加噪声(HN)模块,用于产生 8kHz 的音频作为指令信号。随后,HN 模块通过基于 UNet 的模块与扩展 WaveNet 相连,该模块将 HN 模块的输出转换为包含essential 周期性和非周期性信息的潜变量序列。除了潜变量序列,扩展 WaveNet 还接受梅尔声谱图作为输入,以生成 48kHz 的高保真唱声。关于判别器,我们将HiFiGAN 中提出的多周期判别器与多分辨率多带 STFT 判别器组合在一起。值得注意的是,InstructSing 在仅使用 4 台 NVIDIA V100 GPU 机器上的训练步骤为其他神经声码器的十分之一时,即可实现与其他声码器相当的语音质量\footnote{演示页面: \href{https://wavelandspeech.github.io/instructsing/}{\texttt{https://wavelandspeech.github.io/inst\ructsing/}}}。我们计划在论文接受后开源代码和预训练模型。

关键词

引用

@article{arxiv.2409.06330,
  title  = {InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself},
  author = {Chang Zeng and Chunhui Wang and Xiaoxiao Miao and Jian Zhao and Zhonglin Jiang and Yong Chen},
  journal= {arXiv preprint arXiv:2409.06330},
  year   = {2024}
}

备注

To appear in 2024 IEEE Spoken Language Technology Workshop, Dec 02-05, 2024, Macao, China