AUTOVC:仅用自编码器损失的零样本语音风格转换
音频与语音处理
2019-06-07 v2 人工智能
机器学习
声音
机器学习
摘要
非平行多对多语音转换以及零样本语音转换仍是未被充分探索的领域。深度风格转换算法,如生成对抗网络(GAN)和条件变分自编码器(CVAE),正作为该领域的新方案被应用。然而,GAN 训练复杂且困难,并且没有强有力的证据表明其生成的语音具有良好的感知质量。另一方面,CVAE 训练简单但不具备 GAN 的分布匹配特性。本文提出一种新的风格转换方案,仅涉及一个带有精心设计的瓶颈的自编码器。我们形式化地表明,该方案仅通过自重建损失训练即可实现分布匹配的风格转换。基于此方案,我们提出了 AUTOVC,其在非平行数据的多对多语音转换中取得了最先进(state-of-the-art)结果,并且是首个实现零样本语音转换的方法。
引用
@article{arxiv.1905.05879,
title = {AUTOVC: Zero-Shot Voice Style Transfer with Only Autoencoder Loss},
author = {Kaizhi Qian and Yang Zhang and Shiyu Chang and Xuesong Yang and Mark Hasegawa-Johnson},
journal= {arXiv preprint arXiv:1905.05879},
year = {2019}
}
备注
To Appear in Thirty-sixth International Conference on Machine Learning (ICML 2019)