中文

MFCCGAN:一种基于 MFCC 并利用对抗学习的新型语音合成器

声音 2023-10-26 v1 人工智能 音频与语音处理

摘要

本文介绍 MFCCGAN,一种基于对抗学习的新型语音合成器,其采用 MFCC 作为输入并生成原始语音波形。得益于 GAN 模型的能力,它生成的语音比基于规则的 MFCC 语音合成器 WORLD 具有更高的可懂度。我们基于一种流行的侵入式客观语音可懂度度量(STOI)和质量度量(NISQA 分数)对模型进行评估。实验结果表明,与 Librosa MFCC 逆变换相比,我们所提系统的 STOI 提升约 26% 至 53%、NISQA 分数提升 16% 至 78%;与 CycleGAN-VC 系列中使用的常规基于规则的声码器 WORLD 相比,可懂度提升约 10%、自然度提升约 4%。然而,WORLD 需要如 F0 等额外数据。最后,在基于 STOI 的判别器中使用感知损失可进一步提升质量。基于 WebMUSHRA 的主观测试也显示了所提方法的质量。

关键词

引用

@article{arxiv.2306.12785,
  title  = {MFCCGAN: A Novel MFCC-Based Speech Synthesizer Using Adversarial Learning},
  author = {Mohammad Reza Hasanabadi Majid Behdad Davood Gharavian},
  journal= {arXiv preprint arXiv:2306.12785},
  year   = {2023}
}

备注

ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)