基于条件DSVAE改进零样本语音转换
音频与语音处理
2022-06-22 v2 人工智能
计算与语言
声音
摘要
解耦内容与说话风格信息对于零样本非平行语音转换(VC)至关重要。我们之前的研究探索了一种以解耦序列变分自编码器(DSVAE)为骨干进行信息分解的新框架。我们已证明从单条语音中同时解耦内容嵌入与说话人嵌入用于零样本VC是可行的。在本研究中,我们延续该方向,提出对DSVAE基线中内容分支先验分布的一个担忧。我们发现随机初始化的先验分布会迫使内容嵌入在学习过程中削弱音素结构信息,这并非期望特性。在此,我们寻求获得保留更多音素信息的更好内容嵌入。我们提出条件DSVAE,一种新模型,它将内容偏置作为先验建模的条件,并重塑从后验分布采样的内容嵌入。在VCTK数据集上的实验中,我们证明由条件DSVAE导出的内容嵌入克服了随机性,相比有竞争力的DSVAE基线实现了更好的音素分类准确率、更稳定的发声以及更好的零样本VC性能。
引用
@article{arxiv.2205.05227,
title = {Towards Improved Zero-shot Voice Conversion with Conditional DSVAE},
author = {Jiachen Lian and Chunlei Zhang and Gopala Krishna Anumanchipalli and Dong Yu},
journal= {arXiv preprint arXiv:2205.05227},
year = {2022}
}
备注
Accepted to 2022 Interspeech. Demo link is here https://jlian2.github.io/Improved-Voice-Conversion-with-Conditional-DSVAE/