中文

歌唱语音合成中的音高保持

声音 2021-10-13 v2 人工智能 音频与语音处理

摘要

受限于歌唱语音语料规模,现有歌唱语音合成(SVS)方法构建编码器-解码器神经网络直接生成频谱图,可能在推理阶段导致跑调问题。为缓解这些问题,本文提出一种具有独立音高编码器与音素编码器的新型声学模型,从乐谱中解耦音素与音高信息以充分利用语料。具体而言,依据十二平均律理论,音高编码器受音高度量损失约束,该损失将相邻输入音高间的距离映射为编码器输出间对应的频率倍数。对于音素编码器,基于相同音素对应不同音高可产生相似发音的分析,该编码器后接对抗训练的音高分类器,以强制不同音高的相同音素映射至同一音素特征空间。通过这些方式,原始输入空间中稀疏的音素与音高可分别转换为更紧凑的特征空间,其中相同元素紧密聚类并相互协作以提升合成质量。随后,两编码器输出求和传入声学模型后续解码器。实验结果表明,所提方法能刻画音高输入间内在结构,获得更优音高合成精度,并取得优于先进基线系统的歌唱合成性能。

关键词

引用

@article{arxiv.2110.05033,
  title  = {Pitch Preservation In Singing Voice Synthesis},
  author = {Shujun Liu and Hai Zhu and Kun Wang and Huajun Wang},
  journal= {arXiv preprint arXiv:2110.05033},
  year   = {2021}
}

备注

5 pages, 3 figures