中文

Wave-U-Net 判别器:用于基于生成对抗网络的语音合成的快速轻量判别器

声音 2023-03-27 v1 机器学习 音频与语音处理 信号处理

摘要

在语音合成中,生成对抗网络(GAN)以极小极大博弈训练生成器(语音合成器)与判别器,被广泛用于提升语音质量。近期的神经声码器(如 HiFi-GAN)与端到端文本到语音(TTS)系统(如 VITS)常使用判别器集成,从多角度审视波形。此类判别器使合成语音充分逼近真实语音;然而,它们需随判别器数量增加而增大模型规模与计算时间。作为替代,本研究提出 Wave-U-Net 判别器,一种单一但具表现力的采用 Wave-U-Net 架构的判别器。该判别器独特之处在于:它能以与输入信号相同分辨率逐样本评估波形,同时通过带跳跃连接的编码器与解码器提取多级特征。该架构为生成器提供充分丰富的信息,使合成语音紧密匹配真实语音。实验中,所提思路应用于代表性神经声码器(HiFi-GAN)与端到端 TTS 系统(VITS)。结果表明,所提模型在 HiFi-GAN 中可实现相当语音质量且判别器快 2.31 倍、轻量 14.5 倍,在 VITS 中快 1.90 倍、轻量 9.62 倍。音频样本见 https://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/waveunetd/。

关键词

引用

@article{arxiv.2303.13909,
  title  = {Wave-U-Net Discriminator: Fast and Lightweight Discriminator for Generative Adversarial Network-Based Speech Synthesis},
  author = {Takuhiro Kaneko and Hirokazu Kameoka and Kou Tanaka and Shogo Seki},
  journal= {arXiv preprint arXiv:2303.13909},
  year   = {2023}
}

备注

Accepted to ICASSP 2023. Project page: https://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/waveunetd/