中文

ACE-Step:迈向音乐生成基础模型的一步

声音 2025-06-03 v1 音频与语音处理

摘要

我们介绍了ACE-Step,一种用于音乐生成的新型开源基础模型,它克服了现有方法的关键局限性,并通过整体架构设计实现了最先进的性能。当前方法在生成速度、音乐连贯性和可控性之间存在固有的权衡。例如,基于LLM的模型(如Yue、SongGen)擅长歌词对齐,但推理速度慢且存在结构性伪影。另一方面,扩散模型(如DiffRhythm)能实现更快的合成,但通常缺乏长程结构连贯性。ACE-Step通过将基于扩散的生成与Sana的深度压缩自编码器(DCAE)和轻量级线性Transformer相结合,弥合了这一差距。它还利用MERT和m-hubert在训练期间对齐语义表示(REPA),从而实现快速收敛。因此,我们的模型在A100 GPU上仅需20秒即可合成长达4分钟的音乐——比基于LLM的基线快15倍——同时在旋律、和声和节奏指标上实现了更优的音乐连贯性和歌词对齐。此外,ACE-Step保留了细粒度的声学细节,支持高级控制机制,如声音克隆、歌词编辑、混音和音轨生成(如lyric2vocal、singing2accompaniment)。我们的愿景不是构建又一个端到端的文本到音乐流水线,而是为音乐AI建立一个基础模型:一种快速、通用、高效且灵活的架构,使其易于在其上训练子任务。这为开发能够无缝集成到音乐艺术家、制作人和内容创作者创作流程中的强大工具铺平了道路。简而言之,我们的目标是为音乐打造一个“稳定扩散时刻”。代码、模型权重和演示可在以下地址获取:https://ace-step.github.io/。

关键词

引用

@article{arxiv.2506.00045,
  title  = {ACE-Step: A Step Towards Music Generation Foundation Model},
  author = {Junmin Gong and Sean Zhao and Sen Wang and Shengyuan Xu and Joe Guo},
  journal= {arXiv preprint arXiv:2506.00045},
  year   = {2025}
}

备注

14 pages, 5 figures, ace-step's tech report