JEN-1:基于全向扩散模型的文本引导通用音乐生成
声音
2025-05-08 v2 人工智能
机器学习
多媒体
音频与语音处理
摘要
随着深度生成模型的发展,音乐生成引起了越来越多的关注。然而,由于音乐结构的复杂性和高采样率要求,以文本描述 conditioned 生成音乐(称为文本到音乐)仍然具有挑战性。尽管该任务很重要,但现有的生成模型在音乐质量、计算效率和泛化能力方面存在局限。本文介绍JEN-1,一种用于文本到音乐生成的通用高保真模型。JEN-1是一种结合了自回归和非自回归训练的扩散模型。通过上下文学习,JEN-1可执行多种生成任务,包括文本引导音乐生成、音乐修复和续写。评估表明,JEN-1在文本-音乐对齐和音乐质量上优于最先进(SOTA)方法,同时保持计算效率。我们的演示可在 https://jenmusic.ai/audio-demos 获取。
引用
@article{arxiv.2308.04729,
title = {JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models},
author = {Peike Li and Boyu Chen and Yao Yao and Yikai Wang and Allen Wang and Alex Wang},
journal= {arXiv preprint arXiv:2308.04729},
year = {2025}
}
备注
Github Demo Page: https://gogoduck912.github.io/Jen1-Demo-Page/