用于受损语音非平行转换的生成对抗网络
音频与语音处理
2019-08-26 v3 机器学习
声音
摘要
本文关注利用语音转换(VC)来改善因发音器官部分切除而接受手术的患者的语音可懂度。由于数据收集困难,无需平行数据的语音转换备受期待。尽管已有针对非平行语音转换的技术(例如 CycleGAN)被提出,但它们通常侧重于转换说话人身份,即将一个说话人的语音直接转换为另一说话人的语音,因此并未解决本文任务。本文提出一种用于非平行语音转换的新方法。该方法在保留语言内容与说话人特征的同时,将受损语音转换为正常语音。据我们所知,这是首个应用于受损语音的基于端到端 GAN 的无监督语音转换模型。实验结果表明,所提方法优于 CycleGAN。
引用
@article{arxiv.1810.12656,
title = {Generative Adversarial Networks for Unpaired Voice Transformation on Impaired Speech},
author = {Li-Wei Chen and Hung-Yi Lee and Yu Tsao},
journal= {arXiv preprint arXiv:1810.12656},
year = {2019}
}
备注
Published as a conference paper at INTERSPEECH 2019