中文

DSPGAN:一种基于 GAN 并利用 DSP 时频域监督实现高保真 TTS 的通用声码器

声音 2023-05-30 v3 音频与语音处理

摘要

近年来基于生成对抗神经网络(GAN)的神经声码器的发展已显示出以快速推理速度和轻量网络生成以 mel 谱图为条件的原始波形的明显优势。然而,训练一个能从包含未知说话人、语言和说话风格的各种场景中合成高保真语音的通用神经声码器仍具挑战性。本文中,我们提出 DSPGAN,一种基于 GAN 的通用声码器,通过应用来自数字信号处理(DSP)的时频域监督来实现高保真语音合成。为消除训练阶段真实谱图与推理阶段预测谱图所带来的不匹配问题,我们利用由 DSP 模块生成的波形中提取的 mel 谱图,而非来自 Text-to-Speech(TTS)声学模型的预测 mel 谱图,作为基于 GAN 的声码器的时频域监督。我们还利用正弦激励作为时域监督以改善谐波建模并消除基于 GAN 的声码器的各种伪影。实验表明,DSPGAN 显著优于对比方法,并且能为使用多样数据训练的各种 TTS 模型生成高保真语音。

关键词

引用

@article{arxiv.2211.01087,
  title  = {DSPGAN: a GAN-based universal vocoder for high-fidelity TTS by time-frequency domain supervision from DSP},
  author = {Kun Song and Yongmao Zhang and Yi Lei and Jian Cong and Hanzhao Li and Lei Xie and Gang He and Jinfeng Bai},
  journal= {arXiv preprint arXiv:2211.01087},
  year   = {2023}
}

备注

Accepted to ICASSP 2023