中文

Diff-A-Riff:基于潜在扩散模型的音乐伴奏协同创作

声音 2024-10-31 v2 人工智能 音频与语音处理

摘要

深度生成模型的最新进展为音乐制作带来了新的机遇,但也带来了挑战,例如高计算需求和有限的音频质量。此外,当前系统通常仅依赖文本输入,并且通常专注于生成完整的音乐作品,这与现有的音乐制作工作流程不兼容。为了解决这些问题,我们引入了“Diff-A-Riff”,这是一种潜在扩散模型,旨在生成适用于任何音乐背景的高质量器乐伴奏。该模型通过音频参考、文本提示或两者结合提供控制,生成48kHz伪立体声音频,同时显著减少推理时间和内存使用。我们通过客观指标和主观听力测试展示了该模型的能力,并在配套网站sonycslparis.github.io/diffariff-companion/上提供了大量示例。

关键词

引用

@article{arxiv.2406.08384,
  title  = {Diff-A-Riff: Musical Accompaniment Co-creation via Latent Diffusion Models},
  author = {Javier Nistal and Marco Pasini and Cyran Aouameur and Maarten Grachten and Stefan Lattner},
  journal= {arXiv preprint arXiv:2406.08384},
  year   = {2024}
}

备注

8 pages, 2 figures, 3 tables