中文

基于扩散模型的音乐风格迁移

声音 2024-04-24 v1 人工智能

摘要

以往关于音乐风格迁移的研究主要集中在一对一的风格转换上,这具有较大的局限性。当考虑多种风格之间的转换时,以往的方法需要设计多种模式来解耦音乐复杂的风格,导致计算成本高且音频生成缓慢。现有的音乐风格迁移方法生成的频谱图带有伪影,导致生成的音频中存在明显的噪声。为了解决这些问题,本研究提出了一种基于扩散模型的音乐风格迁移框架,并使用基于频谱图的方法来实现多对多音乐风格迁移。该框架采用 GuideDiff 方法将频谱图恢复为高保真音频,加快了音频生成速度并减少了生成音频中的噪声。实验结果表明,与基线相比,我们的模型在多模式音乐风格迁移中具有良好的性能,并能在消费级 GPU 上实时生成高质量音频。

关键词

引用

@article{arxiv.2404.14771,
  title  = {Music Style Transfer With Diffusion Model},
  author = {Hong Huang and Yuyi Wang and Luyao Li and Jun Lin},
  journal= {arXiv preprint arXiv:2404.14771},
  year   = {2024}
}

备注

8 pages, 6 figures, ICMC 2023