中文

利用旋律无监督预训练增强单说话人歌唱语音合成的音域

声音 2023-09-04 v1 计算与语言 音频与语音处理

摘要

单说话人歌唱语音合成(SVS)通常在超出歌手音域或训练样本有限的音高值上表现不佳。基于我们之前的工作,本文提出一种在多歌手数据集上进行的旋律无监督多说话人预训练方法,以增强单说话人的音域,同时不降低音色相似度。该预训练方法可部署于大规模多歌手数据集,其仅包含音频-歌词对,无音素时间对齐信息与音高标注。具体而言,在预训练步骤中,我们设计了一个音素预测器来生成帧级音素概率向量作为音素时间信息,以及一个说话人编码器来建模不同歌手的音色变化,并直接从音频估计帧级f0值以提供音高信息。这些预训练的模型参数作为先验知识传入微调步骤,以增强单说话人的音域。此外,本工作也有助于提升合成歌声的音质与节奏自然度。首次引入可微时长调节器以改善合成语音的节奏自然度,以及双向流模型以改善音质。实验结果验证了所提SVS系统在音质与自然度上均优于基线。

关键词

引用

@article{arxiv.2309.00284,
  title  = {Enhancing the vocal range of single-speaker singing voice synthesis with melody-unsupervised pre-training},
  author = {Shaohuan Zhou and Xu Li and Zhiyong Wu and Ying Shan and Helen Meng},
  journal= {arXiv preprint arXiv:2309.00284},
  year   = {2023}
}