歌唱声音合成中联合训练的系统探索
声音
2023-08-08 v1 音频与语音处理
摘要
端到端声学模型用于歌唱声音合成(SVS)的兴趣日益增长。通常,这些模型需要额外的声码器将生成的声学特征转换为最终波形。然而,由于声学模型与声码器未联合优化,两模型间可能存在鸿沟,导致次优性能。尽管在 TTS 系统中已通过联合训练或用潜表示替代声学特征解决了类似问题,但将相应方法用于 SVS 并非易事。如何改进 SVS 系统的联合训练尚未得到充分探索。本文中,我们系统研究了如何更好地对 SVS 的声学模型与声码器进行联合训练。我们开展了大量实验,表明我们的联合训练策略优于基线,在不同数据集上实现了更稳定的性能,同时提升了整个框架的可解释性。
引用
@article{arxiv.2308.02867,
title = {A Systematic Exploration of Joint-training for Singing Voice Synthesis},
author = {Yuning Wu and Yifeng Yu and Jiatong Shi and Tao Qian and Qin Jin},
journal= {arXiv preprint arXiv:2308.02867},
year = {2023}
}