中文

一种用于歌声合成的旋律无监督模型

音频与语音处理 2022-04-15 v2 机器学习 声音

摘要

近期歌声合成的研究借助基于深度神经网络的文本到语音模型的进展取得了高质量的结果。训练歌声合成模型的主要问题之一是它们需要旋律和歌词标签与音频数据在时间上对齐。时间对齐是在准备训练数据时的耗时人工工作。为解决该问题,我们提出了一种旋律无监督模型,该模型在训练时仅需要音频-歌词对而无需时间对齐,但在推理时给定旋律和歌词输入即可生成歌声音频。所提模型由音素分类器和歌声生成器组成,以端到端方式联合训练。该模型可通过调整具有时间对齐旋律标签的监督量进行微调。通过在旋律无监督和半监督设置下的实验,我们比较了合成歌声的音频质量。我们还展示了所提模型能够用语音音频和文本标签训练,但在推理时可生成歌声。

关键词

引用

@article{arxiv.2110.06546,
  title  = {A Melody-Unsupervision Model for Singing Voice Synthesis},
  author = {Soonbeom Choi and Juhan Nam},
  journal= {arXiv preprint arXiv:2110.06546},
  year   = {2022}
}

备注

ICASSP 2022