中文

Karaoker:基于语音训练数据且无对齐的歌唱声音合成

音频与语音处理 2022-09-30 v2 机器学习 声音

摘要

现有的歌唱声音合成模型(SVS)通常在歌唱数据上训练,并依赖于易出错的时序对齐与时长特征或显式的乐谱信息。本文提出 Karaoker,一种基于多说话人 Tacotron、以声音特征为条件的模型,该模型仅在语音数据上训练且不需要时序对齐。Karaoker 依据从 unseen 歌手/说话人源波形中提取的多维模板来合成歌唱声音并迁移风格。模型通过单一深度卷积编码器在包括音高、强度、谐度、共振峰、倒谱峰值突出度和八度音程的连续数据上联合条件化。我们将文本到语音训练目标扩展为包含特征重建、分类和说话人识别任务,以引导模型获得准确结果。除多任务外,我们还采用 Wasserstein GAN 训练方案以及针对声学模型输出的新损失来进一步提升模型质量。

关键词

引用

@article{arxiv.2204.04127,
  title  = {Karaoker: Alignment-free singing voice synthesis with speech training data},
  author = {Panos Kakoulidis and Nikolaos Ellinas and Georgios Vamvoukakis and Konstantinos Markopoulos and June Sig Sung and Gunu Jho and Pirros Tsiakoulis and Aimilios Chalamandaris},
  journal= {arXiv preprint arXiv:2204.04127},
  year   = {2022}
}

备注

Accepted to INTERSPEECH 2022