基于条件自编码器的F0一致多方非平行语音转换
音频与语音处理
2020-04-17 v1 机器学习
声音
机器学习
摘要
非平行多方语音转换仍是一项有趣但具挑战性的语音处理任务。许多受风格迁移启发的方法如生成对抗网络(GANs)和变分自编码器(VAEs)已被提出。近来,基于条件自编码器(CAEs)的AutoVC方法通过信息约束瓶颈解耦说话人身份与语音内容,取得了最先进的结果,并通过替换不同说话人的身份嵌入来实现零样本转换以合成新声音。然而,我们发现尽管说话人身份与语音内容已解耦,大量韵律信息(如源F0)仍泄漏通过瓶颈,导致目标F0不自然地波动。此外,AutoVC无法控制转换后的F0,因此不适用于许多应用。本文中,我们改进并优化了基于自编码器的语音转换,以同时解耦内容、F0与说话人身份。因此,我们能够控制F0轮廓,生成与目标说话人F0一致的语音,并显著提升质量与相似度。我们通过定量与定性分析支撑了我们的改进。
引用
@article{arxiv.2004.07370,
title = {F0-consistent many-to-many non-parallel voice conversion via conditional autoencoder},
author = {Kaizhi Qian and Zeyu Jin and Mark Hasegawa-Johnson and Gautham J. Mysore},
journal= {arXiv preprint arXiv:2004.07370},
year = {2020}
}