Diff-A-Riff:基于潜在扩散模型的音乐伴奏协同创作
声音
2024-10-31 v2 人工智能
音频与语音处理
摘要
深度生成模型的最新进展为音乐制作带来了新的机遇,但也带来了挑战,例如高计算需求和有限的音频质量。此外,当前系统通常仅依赖文本输入,并且通常专注于生成完整的音乐作品,这与现有的音乐制作工作流程不兼容。为了解决这些问题,我们引入了“Diff-A-Riff”,这是一种潜在扩散模型,旨在生成适用于任何音乐背景的高质量器乐伴奏。该模型通过音频参考、文本提示或两者结合提供控制,生成48kHz伪立体声音频,同时显著减少推理时间和内存使用。我们通过客观指标和主观听力测试展示了该模型的能力,并在配套网站sonycslparis.github.io/diffariff-companion/上提供了大量示例。
引用
@article{arxiv.2406.08384,
title = {Diff-A-Riff: Musical Accompaniment Co-creation via Latent Diffusion Models},
author = {Javier Nistal and Marco Pasini and Cyran Aouameur and Maarten Grachten and Stefan Lattner},
journal= {arXiv preprint arXiv:2406.08384},
year = {2024}
}
备注
8 pages, 2 figures, 3 tables