基于 DDSP 的歌唱声音合成潜空间探索
声音
2021-03-15 v1 机器学习
多媒体
音频与语音处理
摘要
基于机器学习的歌唱声音模型需要大型数据集和漫长的训练时间。在这项工作中,我们提出了一种轻量架构,基于可微分数字信号处理(Differentiable Digital Signal Processing, DDSP)库,在仅以音高和振幅为条件、使用未处理音频的小数据集训练十二小时后,能够输出类歌曲的发声。结果很有前景,因为旋律和歌手的声音均可辨识。此外,我们提供了两个零配置工具来训练新模型并对其进行实验。目前我们正在探索 DDSP 库中包含但原始 DDSP 示例中未包含的潜空间表示。我们的结果表明,潜空间改善了歌手的辨识度以及歌词的可理解性。我们的代码可在 https://github.com/juanalonso/DDSP-singing-experiments 获取,其中包含零配置 notebook 的链接,我们的声音示例位于 https://juanalonso.github.io/DDSP-singing-experiments/ 。
引用
@article{arxiv.2103.07197,
title = {Latent Space Explorations of Singing Voice Synthesis using DDSP},
author = {Juan Alonso and Cumhur Erkut},
journal= {arXiv preprint arXiv:2103.07197},
year = {2021}
}