中文

基于 DDSP 的歌唱声音合成潜空间探索

声音 2021-03-15 v1 机器学习 多媒体 音频与语音处理

摘要

基于机器学习的歌唱声音模型需要大型数据集和漫长的训练时间。在这项工作中,我们提出了一种轻量架构,基于可微分数字信号处理(Differentiable Digital Signal Processing, DDSP)库,在仅以音高和振幅为条件、使用未处理音频的小数据集训练十二小时后,能够输出类歌曲的发声。结果很有前景,因为旋律和歌手的声音均可辨识。此外,我们提供了两个零配置工具来训练新模型并对其进行实验。目前我们正在探索 DDSP 库中包含但原始 DDSP 示例中未包含的潜空间表示。我们的结果表明,潜空间改善了歌手的辨识度以及歌词的可理解性。我们的代码可在 https://github.com/juanalonso/DDSP-singing-experiments 获取,其中包含零配置 notebook 的链接,我们的声音示例位于 https://juanalonso.github.io/DDSP-singing-experiments/ 。

关键词

引用

@article{arxiv.2103.07197,
  title  = {Latent Space Explorations of Singing Voice Synthesis using DDSP},
  author = {Juan Alonso and Cumhur Erkut},
  journal= {arXiv preprint arXiv:2103.07197},
  year   = {2021}
}