用于无平行数据语音转换的对抗训练自编码器
音频与语音处理
2019-05-13 v1 机器学习
声音
摘要
我们提出了一种在若干说话人之间进行语音转换的方法。我们的方法基于训练多条自编码器路径,其中有一个说话人无关的编码器以及多个说话人相关的解码器。自编码器的训练加入了一个由辅助分类器提供的对抗损失,以引导编码器的输出与说话人无关。该模型的训练是无监督的,即不需要收集说话人相同的语句,也不需要在音素上进行时间对齐。由于使用了单一编码器,我们的方法能够泛化到将训练外说话人的语音转换为训练数据集中的说话人。我们给出了主观测试以证实我们方法的性能。
引用
@article{arxiv.1905.03864,
title = {Adversarially Trained Autoencoders for Parallel-Data-Free Voice Conversion},
author = {Orhan Ocal and Oguz H. Elibol and Gokce Keskin and Cory Stephenson and Anil Thomas and Kannan Ramchandran},
journal= {arXiv preprint arXiv:1905.03864},
year = {2019}
}