中文

歌唱声音合成中联合训练的系统探索

声音 2023-08-08 v1 音频与语音处理

摘要

端到端声学模型用于歌唱声音合成(SVS)的兴趣日益增长。通常,这些模型需要额外的声码器将生成的声学特征转换为最终波形。然而,由于声学模型与声码器未联合优化,两模型间可能存在鸿沟,导致次优性能。尽管在 TTS 系统中已通过联合训练或用潜表示替代声学特征解决了类似问题,但将相应方法用于 SVS 并非易事。如何改进 SVS 系统的联合训练尚未得到充分探索。本文中,我们系统研究了如何更好地对 SVS 的声学模型与声码器进行联合训练。我们开展了大量实验,表明我们的联合训练策略优于基线,在不同数据集上实现了更稳定的性能,同时提升了整个框架的可解释性。

关键词

引用

@article{arxiv.2308.02867,
  title  = {A Systematic Exploration of Joint-training for Singing Voice Synthesis},
  author = {Yuning Wu and Yifeng Yu and Jiatong Shi and Tao Qian and Qin Jin},
  journal= {arXiv preprint arXiv:2308.02867},
  year   = {2023}
}