中文

非自回归TTS中说话人嵌入选择影响的分析

音频与语音处理 2023-07-20 v1 人工智能

摘要

在本文中,我们首次尝试理解非自回归分解多说话人语音合成架构如何利用不同说话人嵌入集中存在的信息。我们分析了联合学习表示以及从预训练模型初始化是否会对目标说话人身份带来任何质量提升。在另一项独立分析中,我们研究了不同嵌入集如何影响网络的核心语音抽象(即零条件)在说话人身份与表示学习方面的表现。我们表明,无论使用哪组嵌入和学习策略,该网络都能同样良好地处理各种说话人身份,语音输出质量差异微乎其微,并且在迄今采用的标准训练流程中,合成系统核心结构内的说话人泄漏(speaker leakage)是不可避免的。

关键词

引用

@article{arxiv.2307.09898,
  title  = {An analysis on the effects of speaker embedding choice in non auto-regressive TTS},
  author = {Adriana Stan and Johannah O'Mahony},
  journal= {arXiv preprint arXiv:2307.09898},
  year   = {2023}
}

备注

Accepted for publication at ISCA Speech Synthesis Workshop 2023