使用局部风格令牌与双路径音高编码器的表现力歌声合成
声音
2022-04-08 v1 音频与语音处理
摘要
本文提出了一种可控的歌声合成系统,能够通过两种新颖的方法生成富有表现力的歌声。首先,提出了一个局部风格令牌模块,该模块从输入的音高和文本序列中预测帧级风格令牌,使歌声系统能够控制乐谱中通常未指定的音乐表现(如呼吸和强度)。其次,我们提出了一种双路径音高编码器,可选择两种不同的音高输入:MIDI 音高序列或 f0 轮廓。由于歌声的初始生成通常通过采用 MIDI 音高序列来执行,用户可以随后从生成的歌声中提取 f0 轮廓,并根据需要将 f0 轮廓修改到更精细的水平。通过定量和定性评估,我们确认所提出的模型能够控制各种音乐表现,同时不牺牲歌声合成系统的音质。
引用
@article{arxiv.2204.03249,
title = {Expressive Singing Synthesis Using Local Style Token and Dual-path Pitch Encoder},
author = {Juheon Lee and Hyeong-Seok Choi and Kyogu Lee},
journal= {arXiv preprint arXiv:2204.03249},
year = {2022}
}
备注
4 pages, Submitted to Interspeech 2022