中文

采用感知加权谱图损失的改进并行 WaveGAN 声码器

音频与语音处理 2021-01-20 v1 声音

摘要

本文提出一种用于基于并行 WaveGAN 的文本到语音(TTS)系统的谱域感知加权技术。近期提出的并行 WaveGAN 声码器利用快速非自回归 WaveNet 模型成功生成波形序列。通过采用多分辨率短时傅里叶变换(MR-STFT)准则与生成对抗网络,轻量级卷积网络无需任何蒸馏过程即可被有效训练。为了进一步提升声码器性能,我们提出将频率相关权重应用于 MR-STFT 损失函数。所提方法对频域中感知敏感的错误进行惩罚;因此,模型被优化以减少合成语音中的听觉噪声。主观听音测试结果表明,我们提出的方法对韩语女声和男声说话者分别取得了 4.21 和 4.26 的 TTS 平均意见得分。

关键词

引用

@article{arxiv.2101.07412,
  title  = {Improved parallel WaveGAN vocoder with perceptually weighted spectrogram loss},
  author = {Eunwoo Song and Ryuichi Yamamoto and Min-Jae Hwang and Jin-Seob Kim and Ohsung Kwon and Jae-Min Kim},
  journal= {arXiv preprint arXiv:2101.07412},
  year   = {2021}
}

备注

To appear in SLT 2021