中文

MelGAN-VC:基于谱图对任意长度样本进行语音转换与音频风格迁移

音频与语音处理 2019-12-06 v2 机器学习 声音

摘要

传统语音转换方法依赖于多个说话人朗读相同句子的平行录音。然而,对于实际应用而言,平行数据极少可得。我们提出 MelGAN-VC,一种依赖非平行语音数据且能够将任意长度音频信号从源音色转换到目标音色的语音转换方法。我们首先从波形数据计算谱图,随后使用生成对抗网络(GAN)架构进行域翻译。一个额外的孪生网络有助于在翻译过程中保留语音信息,且不牺牲灵活建模目标说话人风格的能力。我们使用干净语音录音数据集以及一组含噪真实世界语音样本测试了我们的框架。最后,我们将同一方法应用于音乐风格迁移,将任意长度音乐样本从一种流派翻译到另一种流派,并表明我们的框架具有灵活性,可用于不同于语音转换的音频处理应用。

关键词

引用

@article{arxiv.1910.03713,
  title  = {MelGAN-VC: Voice Conversion and Audio Style Transfer on arbitrarily long samples using Spectrograms},
  author = {Marco Pasini},
  journal= {arXiv preprint arXiv:1910.03713},
  year   = {2019}
}