中文

基于与文本转语音多任务学习的情感语音转换

音频与语音处理 2019-11-28 v2 计算与语言 声音

摘要

语音转换(VC)是一项在保留语言内容的同时将人的声音转换为不同风格的任务。先前VC上的最优方法基于序列到序列(seq2seq)模型,其可能误导语言信息。曾有尝试通过使用文本监督来克服该问题,但这需要显式对齐,从而丧失了使用seq2seq模型的优势。本文提出一种利用与文本转语音(TTS)多任务学习的语音转换器。基于seq2seq的TTS的嵌入空间包含丰富的文本信息。TTS解码器的作用是将嵌入空间转换为语音,这与VC相同。在所提模型中,整个网络被训练以最小化VC和TTS的损失。期望VC通过多任务学习捕获更多语言信息并保持训练稳定性。VC实验在男性韩语音情感文本—语音数据集上进行,结果表明多任务学习有助于在VC中保持语言内容。

关键词

引用

@article{arxiv.1911.06149,
  title  = {Emotional Voice Conversion using Multitask Learning with Text-to-speech},
  author = {Tae-Ho Kim and Sungjae Cho and Shinkook Choi and Sejik Park and Soo-Young Lee},
  journal= {arXiv preprint arXiv:1911.06149},
  year   = {2019}
}

备注

4 pages, 3 figures, submitted to ICASSP2020