用于基于DNN的多说话人TTS的人在环说话人自适应
声音
2022-06-22 v1 人机交互
神经与进化计算
音频与语音处理
摘要
本文提出一种用于多说话人文本转语音的人在环说话人自适应方法。在常规说话人自适应方法中,目标说话人的嵌入向量是使用在说话人判别任务上训练的说话人编码器从其参考语音中提取的。然而,当参考语音不可用时,该方法无法获得目标说话人的嵌入向量。我们的方法基于人在环优化框架,该框架引入用户来探索说话人嵌入空间以找到目标说话人的嵌入。所提方法使用顺序线搜索算法,反复要求用户在嵌入空间中的线段上选择一点。为了从多个刺激中高效选择最佳语音样本,我们还开发了一个系统,用户可在循环播放某话语时对每个音素切换多个说话人的声音。实验结果表明,即使不直接将参考语音作为说话人编码器的输入,所提方法在客观和主观评价中也能达到与常规方法相当的性能。
引用
@article{arxiv.2206.10256,
title = {Human-in-the-loop Speaker Adaptation for DNN-based Multi-speaker TTS},
author = {Kenta Udagawa and Yuki Saito and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2206.10256},
year = {2022}
}
备注
5 pages, 3 figures, Accepted for INTERSPEECH2022