中文

PhaseAug:一种用于语音合成的可微分增强方法,以模拟一对多映射

音频与语音处理 2023-05-11 v2 人工智能 声音 信号处理

摘要

以往基于生成对抗网络(GAN)的神经声码器被训练为从成对的梅尔频谱图精确重建真实波形,而未考虑语音合成的一对多关系。这种传统训练导致判别器和生成器均出现过拟合,从而在生成的音频信号中产生周期性伪影。在这项工作中,我们提出了PhaseAug,这是首个用于语音合成的可微分增强方法,通过旋转每个频率仓的相位来模拟一对多映射。使用我们提出的方法,无需任何架构修改即可超越基线模型。代码和音频样本将在https://github.com/mindslab-ai/phaseaug上提供。

关键词

引用

@article{arxiv.2211.04610,
  title  = {PhaseAug: A Differentiable Augmentation for Speech Synthesis to Simulate One-to-Many Mapping},
  author = {Junhyeok Lee and Seungu Han and Hyunjae Cho and Wonbin Jung},
  journal= {arXiv preprint arXiv:2211.04610},
  year   = {2023}
}

备注

Accepted to ICASSP 2023