中文

具有颤音建模与隐能量表示的歌声合成

声音 2022-11-03 v1 音频与语音处理

摘要

本文通过引入显式颤音建模和隐能量表示,提出了一种富有表现力的歌声合成系统。由于人类歌唱的固有特性,颤音对于合成声音的自然度至关重要。因此,本文引入了一种基于深度学习的颤音模型,用于控制歌唱中颤音的相似度、速率、深度和相位,其中颤音相似度表示颤音存在的概率,有助于提升歌声的自然度。实际上,现有歌唱语料库中并无关于颤音相似度的标注标签。我们采用一种新颖的颤音相似度标注方法自动标注颤音相似度。同时,音频的功率谱图包含丰富信息,可提升歌唱的表现力。我们提出了一种基于自编码器的隐能量瓶颈特征用于富有表现力的歌声合成。在开放数据集 NUS48E 上的实验结果表明,颤音建模与隐能量表示均能显著提升歌声的表现力。音频样本见演示网站。

关键词

引用

@article{arxiv.2211.00996,
  title  = {Singing Voice Synthesis with Vibrato Modeling and Latent Energy Representation},
  author = {Yingjie Song and Wei Song and Wei Zhang and Zhengchen Zhang and Dan Zeng and Zhi Liu and Yang Yu},
  journal= {arXiv preprint arXiv:2211.00996},
  year   = {2022}
}