用于无监督音乐音频音色迁移的潜在扩散桥
声音
2025-01-08 v4 人工智能
信息检索
音频与语音处理
摘要
音乐音色迁移是一项具有挑战性的任务,涉及修改音频信号的音色特征同时保留其旋律结构。在本文中,我们提出了一种基于双重扩散桥的新方法,使用CocoChorales数据集进行训练,该数据集由不成对的单声道单乐器音频数据组成。每个扩散模型都使用高斯先验在特定乐器上进行训练。在推理过程中,一个模型被指定为源模型,将输入音频映射到其对应的高斯先验,另一个模型被指定为目标模型,从该高斯先验重建目标音频,从而实现音色迁移。我们将我们的方法与现有的无监督音色迁移模型(如VAEGAN和高斯流桥(GFB))进行了比较。实验结果表明,与VAEGAN和GFB相比,我们的方法实现了更好的弗雷歇音频距离(FAD)和旋律保留,这反映在更低的音高距离(DPD)上。此外,我们发现高斯先验的噪声水平可以调整,以控制旋律保留的程度和音色迁移的量。
引用
@article{arxiv.2409.06096,
title = {Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer},
author = {Michele Mancusi and Yurii Halychanskyi and Kin Wai Cheuk and Eloi Moliner and Chieh-Hsin Lai and Stefan Uhlich and Junghyun Koo and Marco A. Martínez-Ramírez and Wei-Hsiang Liao and Giorgio Fabbro and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2409.06096},
year = {2025}
}