基于与文本转语音多任务学习的情感语音转换
音频与语音处理
2019-11-28 v2 计算与语言
声音
摘要
语音转换(VC)是一项在保留语言内容的同时将人的声音转换为不同风格的任务。先前VC上的最优方法基于序列到序列(seq2seq)模型,其可能误导语言信息。曾有尝试通过使用文本监督来克服该问题,但这需要显式对齐,从而丧失了使用seq2seq模型的优势。本文提出一种利用与文本转语音(TTS)多任务学习的语音转换器。基于seq2seq的TTS的嵌入空间包含丰富的文本信息。TTS解码器的作用是将嵌入空间转换为语音,这与VC相同。在所提模型中,整个网络被训练以最小化VC和TTS的损失。期望VC通过多任务学习捕获更多语言信息并保持训练稳定性。VC实验在男性韩语音情感文本—语音数据集上进行,结果表明多任务学习有助于在VC中保持语言内容。
引用
@article{arxiv.1911.06149,
title = {Emotional Voice Conversion using Multitask Learning with Text-to-speech},
author = {Tae-Ho Kim and Sungjae Cho and Shinkook Choi and Sejik Park and Soo-Young Lee},
journal= {arXiv preprint arXiv:1911.06149},
year = {2019}
}
备注
4 pages, 3 figures, submitted to ICASSP2020