中文

RAF:用于通用语音合成的相对对抗性反馈

音频与语音处理 2026-03-13 v1 声音

摘要

我们提出了相对对抗性反馈(RAF),这是一种用于GAN语音合成器的新型训练目标,通过该目标在域内保真度和对未见场景的泛化能力方面均取得改进。尽管现代GAN语音合成器采用先进的架构,但其训练目标常常难以促进通用表示。RAF通过利用语音自监督学习模型帮助判别器评估样本质量,鼓励生成器学习更丰富的表示。此外,我们利用相对配对来处理真实和伪造波形,以改进对训练数据分布的建模。跨多个数据集的实验表明,RAF在GAN语音合成器的客观和主观指标上均实现了一致的提升。重要的是,使用RAF训练的BigVGAN-base在感知质量方面优于LSGAN训练的BigVGAN,仅需12%的参数。比较研究进一步确认了RAF作为GAN语音合成器训练框架的有效性。

关键词

引用

@article{arxiv.2603.11678,
  title  = {RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis},
  author = {Yongjoon Lee and Jung-Woo Choi},
  journal= {arXiv preprint arXiv:2603.11678},
  year   = {2026}
}

备注

Submitted to Interspeech 2026