中文

用于受损语音非平行转换的生成对抗网络

音频与语音处理 2019-08-26 v3 机器学习 声音

摘要

本文关注利用语音转换(VC)来改善因发音器官部分切除而接受手术的患者的语音可懂度。由于数据收集困难,无需平行数据的语音转换备受期待。尽管已有针对非平行语音转换的技术(例如 CycleGAN)被提出,但它们通常侧重于转换说话人身份,即将一个说话人的语音直接转换为另一说话人的语音,因此并未解决本文任务。本文提出一种用于非平行语音转换的新方法。该方法在保留语言内容与说话人特征的同时,将受损语音转换为正常语音。据我们所知,这是首个应用于受损语音的基于端到端 GAN 的无监督语音转换模型。实验结果表明,所提方法优于 CycleGAN。

关键词

引用

@article{arxiv.1810.12656,
  title  = {Generative Adversarial Networks for Unpaired Voice Transformation on Impaired Speech},
  author = {Li-Wei Chen and Hung-Yi Lee and Yu Tsao},
  journal= {arXiv preprint arXiv:1810.12656},
  year   = {2019}
}

备注

Published as a conference paper at INTERSPEECH 2019