编码器-解码器框架下的语音到歌唱转换
音频与语音处理
2020-02-18 v1 机器学习
声音
摘要
本文的目标是将在的一组口语语句转换为歌唱语句。与先前基于信号处理的方法不同,我们采用基于学习的方法处理该问题。这使我们能够自动建模此转换的各个方面,从而克服对特定输入(如高质量歌唱模板或音素-乐谱同步信息)的依赖。具体地,我们针对该任务提出一个编码器--解码器框架。给定语音的时频表示与目标旋律轮廓,我们学习编码,从而能够合成在保持说话者语言内容与音色的同时遵循目标旋律的歌唱。我们还提出基于多任务学习的客观指标以提升歌词可懂度。我们给出了框架的定量与定性分析。
引用
@article{arxiv.2002.06595,
title = {Speech-to-Singing Conversion in an Encoder-Decoder Framework},
author = {Jayneel Parekh and Preeti Rao and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:2002.06595},
year = {2020}
}
备注
Accepted at IEEE ICASSP 2020