中文

基于扩散模型时变反演的音乐风格迁移

声音 2024-02-22 v1 音频与语音处理

摘要

随着扩散模型的发展,文本引导的图像风格迁移展现了高质量的可控合成结果。然而,利用文本进行多样化的音乐风格迁移面临重大挑战,主要原因在于匹配的音频-文本数据集有限。音乐作为一种抽象且复杂的艺术形式,即使在同一流派内也存在变化与复杂性,因此准确的文本描述极具挑战性。本文提出了一种音乐风格迁移方法,能够使用最少的数据有效捕捉音乐属性。我们引入了一个新颖的时变文本反演模块,以精确捕捉不同层级的梅尔频谱图特征。在推理过程中,我们提出了一种减少偏差的风格化技术以获得稳定的结果。实验结果表明,我们的方法能够迁移特定乐器的风格,以及融入自然声音来 compose 旋律。样本和源代码可在 https://lsfhuihuiff.github.io/MusicTI/ 获取。

关键词

引用

@article{arxiv.2402.13763,
  title  = {Music Style Transfer with Time-Varying Inversion of Diffusion Models},
  author = {Sifei Li and Yuxin Zhang and Fan Tang and Chongyang Ma and Weiming dong and Changsheng Xu},
  journal= {arXiv preprint arXiv:2402.13763},
  year   = {2024}
}

备注

7 pages, 4 figures, AAAI 2024