用于一次性语音转换的残差说话人表征
声音
2024-08-13 v2 音频与语音处理
摘要
近来,语音转换取得了显著进展,实现了高质量的性能。然而,该领域仍有两个关键挑战。首先,当前语音转换方法在遇见未见说话人时鲁棒性有限。其次,它们对音色表征的控制能力也有限。为应对这些挑战,本文提出一种新方法,利用多层残差近似的 token 来增强面对未见说话人时的鲁棒性,称为残差说话人模块。引入多层近似有助于从音色中分离信息,从而实现语音转换中音色的有效控制。所提方法在主观和客观评测中均优于基线,展现出更优的性能和更强的鲁棒性。我们的演示页面已公开可用。
引用
@article{arxiv.2309.08166,
title = {Residual Speaker Representation for One-Shot Voice Conversion},
author = {Le Xu and Jiangyan Yi and Tao Wang and Yong Ren and Rongxiu Zhong and Zhengqi Wen and Jianhua Tao},
journal= {arXiv preprint arXiv:2309.08166},
year = {2024}
}
备注
Accepted by INTERSPEECH2024