利用非平行训练数据进行情感语音转换的频谱与韵律变换
音频与语音处理
2020-10-27 v5 计算与语言
声音
摘要
情感语音转换旨在转换频谱和韵律以改变语音的情感模式,同时保留说话人身份和语言内容。许多研究需要不同情感模式间的平行语音数据,这在实际生活中并不现实。此外,它们常以简单线性变换建模基频(F0)的转换。由于 F0 是语调的关键方面且具有层次性本质,我们认为通过使用小波变换在不同时间尺度上建模 F0 更为恰当。我们提出一种 CycleGAN 网络,通过对抗损失和循环一致性损失同时学习前向与逆映射,从非平行训练数据中寻找最优伪配对。我们还研究了使用连续小波变换(CWT)将 F0 分解为十个时间尺度,以不同时间分辨率描述语音韵律,从而实现有效的 F0 转换。实验结果表明,我们所提框架在客观与主观评价上均优于基线。
引用
@article{arxiv.2002.00198,
title = {Transforming Spectrum and Prosody for Emotional Voice Conversion with Non-Parallel Training Data},
author = {Kun Zhou and Berrak Sisman and Haizhou Li},
journal= {arXiv preprint arXiv:2002.00198},
year = {2020}
}
备注
accepted by Speaker Odyssey 2020 in Tokyo, Japan