Karaoker:基于语音训练数据且无对齐的歌唱声音合成
音频与语音处理
2022-09-30 v2 机器学习
声音
摘要
现有的歌唱声音合成模型(SVS)通常在歌唱数据上训练,并依赖于易出错的时序对齐与时长特征或显式的乐谱信息。本文提出 Karaoker,一种基于多说话人 Tacotron、以声音特征为条件的模型,该模型仅在语音数据上训练且不需要时序对齐。Karaoker 依据从 unseen 歌手/说话人源波形中提取的多维模板来合成歌唱声音并迁移风格。模型通过单一深度卷积编码器在包括音高、强度、谐度、共振峰、倒谱峰值突出度和八度音程的连续数据上联合条件化。我们将文本到语音训练目标扩展为包含特征重建、分类和说话人识别任务,以引导模型获得准确结果。除多任务外,我们还采用 Wasserstein GAN 训练方案以及针对声学模型输出的新损失来进一步提升模型质量。
引用
@article{arxiv.2204.04127,
title = {Karaoker: Alignment-free singing voice synthesis with speech training data},
author = {Panos Kakoulidis and Nikolaos Ellinas and Georgios Vamvoukakis and Konstantinos Markopoulos and June Sig Sung and Gunu Jho and Pirros Tsiakoulis and Aimilios Chalamandaris},
journal= {arXiv preprint arXiv:2204.04127},
year = {2022}
}
备注
Accepted to INTERSPEECH 2022