中文

用于无监督音乐音频音色迁移的潜在扩散桥

声音 2025-01-08 v4 人工智能 信息检索 音频与语音处理

摘要

音乐音色迁移是一项具有挑战性的任务,涉及修改音频信号的音色特征同时保留其旋律结构。在本文中,我们提出了一种基于双重扩散桥的新方法,使用CocoChorales数据集进行训练,该数据集由不成对的单声道单乐器音频数据组成。每个扩散模型都使用高斯先验在特定乐器上进行训练。在推理过程中,一个模型被指定为源模型,将输入音频映射到其对应的高斯先验,另一个模型被指定为目标模型,从该高斯先验重建目标音频,从而实现音色迁移。我们将我们的方法与现有的无监督音色迁移模型(如VAEGAN和高斯流桥(GFB))进行了比较。实验结果表明,与VAEGAN和GFB相比,我们的方法实现了更好的弗雷歇音频距离(FAD)和旋律保留,这反映在更低的音高距离(DPD)上。此外,我们发现高斯先验的噪声水平σ\sigma可以调整,以控制旋律保留的程度和音色迁移的量。

关键词

引用

@article{arxiv.2409.06096,
  title  = {Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer},
  author = {Michele Mancusi and Yurii Halychanskyi and Kin Wai Cheuk and Eloi Moliner and Chieh-Hsin Lai and Stefan Uhlich and Junghyun Koo and Marco A. Martínez-Ramírez and Wei-Hsiang Liao and Giorgio Fabbro and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2409.06096},
  year   = {2025}
}