KaraSinger:基于VQ-VAE与梅尔谱的无乐谱歌唱语音合成
音频与语音处理
2021-10-11 v1 机器学习
声音
摘要
本文提出一种名为KaraSinger的新型神经网络模型,用于一项较少被研究的歌唱语音合成(SVS)任务——无乐谱SVS,其中韵律和旋律由机器自发决定。KaraSinger包含一个向量量化变分自编码器(VQ-VAE),将歌唱音频的梅尔谱压缩为离散码序列,以及一个语言模型(LM),学习在给定相应歌词时预测离散码。对于VQ-VAE部分,我们采用连接主义时序分类(CTC)损失以促使离散码携带音素相关信息。对于LM部分,我们使用位置敏感注意力来学习输入音素序列与输出离散码之间的鲁棒对齐。我们保持VQ-VAE和LM的架构轻量,以实现快速训练和推理速度。我们使用由多位业余歌手演唱的550首英文流行歌曲的专有集合验证了所提设计选择的有效性。听测结果表明,KaraSinger在可懂度、音乐性和整体质量方面均取得高分。
引用
@article{arxiv.2110.04005,
title = {KaraSinger: Score-Free Singing Voice Synthesis with VQ-VAE using Mel-spectrograms},
author = {Chien-Feng Liao and Jen-Yu Liu and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:2110.04005},
year = {2021}
}
备注
Submitted to ICASSP 2022