基于对抗学习解耦音频表示的无并行数据多目标语音转换
音频与语音处理
2018-06-26 v2 计算与语言
声音
摘要
近年来,循环一致对抗网络(Cycle-GAN)已成功应用于无并行数据情况下向不同说话人的语音转换,尽管在这些方法中每个目标说话人都需要一个独立的模型。本文提出一种用于语音转换的对抗学习框架,通过该框架可训练单一模型将语音转换为许多不同说话人,且均无需并行数据,其方式是将语音信号中的说话人特征与语言内容分离。首先训练一个自编码器,利用另一个辅助说话人分类器来正则化潜在表示,从而分别提取与说话人无关的潜在表示和说话人嵌入。随后解码器将以与说话人无关的潜在表示和目标说话人嵌入作为输入,生成具有源语句语言内容的目标说话人语音。通过另一对生成器和判别器产生的残差信号进行修补,进一步提升了解码器输出的质量。初步实验中测试了 20 的目标说话人集合规模,并获得了非常好的语音质量。给出了常规的语音转换指标。我们还展示了说话人信息已从潜在表示中被适当削弱。
引用
@article{arxiv.1804.02812,
title = {Multi-target Voice Conversion without Parallel Data by Adversarially Learning Disentangled Audio Representations},
author = {Ju-chieh Chou and Cheng-chieh Yeh and Hung-yi Lee and Lin-shan Lee},
journal= {arXiv preprint arXiv:1804.02812},
year = {2018}
}
备注
Accepted to Interspeech 2018