中文

端到端零样本语音合成中无需超参数搜索的损失权衡自动调优

音频与语音处理 2023-05-29 v1 人工智能 机器学习

摘要

近来,零样本TTS和VC方法因其实用性——即便训练时未见的语音也能生成——而受到关注。在这些方法中,VITS模型的零样本改进展现出优越性能,同时具备继承自VITS的有用特性。然而,VITS及基于VITS的零样本模型的性能随损失平衡方式不同而有剧烈变化。这可能成为问题,因为需要繁琐地调优损失平衡超参数以寻找最优平衡。本工作中,我们提出一种新颖框架,通过诱导基于VITS模型的解码器达到其完全重建能力,无需搜索即可找到该最优值。借助我们的框架,我们在零样本TTS和VC上展现出优于基线的性能,达到了最先进性能。此外,我们展示了框架在不同设置下的鲁棒性。我们在讨论中对结果给出了解释。

关键词

引用

@article{arxiv.2305.16699,
  title  = {Automatic Tuning of Loss Trade-offs without Hyper-parameter Search in End-to-End Zero-Shot Speech Synthesis},
  author = {Seongyeon Park and Bohyung Kim and Tae-hyun Oh},
  journal= {arXiv preprint arXiv:2305.16699},
  year   = {2023}
}

备注

Interspeech 2023