中文

JEN-1 Composer:一种用于高保真多轨音乐生成的统一框架

声音 2024-12-18 v4 人工智能 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

随着生成式人工智能的快速发展,文本到音乐合成任务已成为音乐生成的一个有前景的方向。然而,实现对多轨生成的精确控制仍是一个开放挑战。尽管现有模型在直接生成多轨混音方面表现出色,但在以可控方式创作各独立音轨并整合它们时,其局限性便显现出来。这种与专业作曲家典型工作流的偏离阻碍了对特定音轨细节的打磨。为弥补这一差距,我们提出JEN-1 Composer,一种统一框架,旨在使用单一模型高效建模多轨音乐上的边缘、条件与联合分布。基于音频隐扩散模型,JEN-1 Composer扩展了多轨音乐生成的多样性。我们引入渐进式课程训练策略,逐步提升训练任务难度,同时确保模型的泛化能力并促进不同场景间的平滑过渡。在推理过程中,用户可迭代生成并选择音乐音轨,从而依据人机协同创作工作流逐步创作整首音乐作品。我们的方法在可控且高保真的多轨音乐合成中展现出最先进的性能,标志着交互式AI辅助音乐创作的重大进展。我们的演示页面可在 www.jenmusic.ai/research 获取。

关键词

引用

@article{arxiv.2310.19180,
  title  = {JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation},
  author = {Yao Yao and Peike Li and Boyu Chen and Alex Wang},
  journal= {arXiv preprint arXiv:2310.19180},
  year   = {2024}
}

备注

9 pages, 3 figures, 3 tables, accepted by AAAI 2025