中文

歌声合成中用于解耦音色与音高的对抗多任务学习

音频与语音处理 2024-06-14 v2 声音

摘要

近来,基于深度学习的生成模型被引入以生成歌声。一种方法是预测由显式语音参数组成的参数化声码器特征,该方法的优势在于各特征含义被显式区分。另一方法是为神经声码器预测梅尔谱。然而,参数化声码器存在音质局限,且梅尔谱特征因音色与音高信息纠缠而难以建模。本研究中,我们提出一种采用多任务学习的歌声合成模型,以同时使用上述两种方法——用于参数化声码器的声学特征与用于神经声码器的梅尔谱。通过将参数化声码器特征作为辅助特征,所提模型可高效解耦并控制梅尔谱中的音色与音高成分。此外,应用生成对抗网络框架以提升多歌手模型中的歌声质量。实验结果表明,我们的模型能比单任务模型生成更自然的歌声,同时优于传统的基于参数化声码器的模型。

关键词

引用

@article{arxiv.2206.11558,
  title  = {Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis},
  author = {Tae-Woo Kim and Min-Su Kang and Gyeong-Hoon Lee},
  journal= {arXiv preprint arXiv:2206.11558},
  year   = {2024}
}

备注

Accepted by Interspeech 2022