基于音素后验概率序列上 Cycle-GAN 的无并行数据节奏灵活语音转换
声音
2018-08-10 v1 音频与语音处理
摘要
语速指单位时间内音素的平均数量,而节奏模式指不同音素在不同语音结构中出现时的时长分布。二者均为语音中韵律的关键组成部分,且因说话人而异。诸如循环一致对抗网络(Cycle-GAN)与变分自编码器(VAE)等模型已成功应用于无并行数据的语音转换任务。然而,由于这些方法所采用的神经网络架构与特征向量,预测语句的长度必须固定为输入语句的长度,这限制了对目标说话人语速与节奏模式进行模仿的灵活性。另一方面,序列到序列学习模型被用于消除上述长度约束,但需要并行训练数据。本文中,我们提出一种利用以无监督 Cycle-GAN 训练的序列到序列模型来执行不同说话人音素后验概率序列间转换的方法。以此方式,上述长度约束被消除,从而提供无需并行数据的节奏灵活语音转换。在两个数据集上的初步评估显示了令人鼓舞的结果。
引用
@article{arxiv.1808.03113,
title = {Rhythm-Flexible Voice Conversion without Parallel Data Using Cycle-GAN over Phoneme Posteriorgram Sequences},
author = {Cheng-chieh Yeh and Po-chun Hsu and Ju-chieh Chou and Hung-yi Lee and Lin-shan Lee},
journal= {arXiv preprint arXiv:1808.03113},
year = {2018}
}
备注
8 pages, 6 figures, Submitted to SLT 2018