提升预训练文本到音乐生成模型的可控性与可编辑性
声音
2024-11-22 v2 音频与语音处理
摘要
AI辅助音乐创作领域已取得显著进展,但现有系统往往难以满足迭代和细致的音乐制作需求。这些挑战包括对生成内容提供充分控制以及允许灵活、精确的编辑。本文通过引入一系列逐步递进的改进来解决这些问题,从而增强文本到音乐生成模型的可控性与可编辑性。首先,我们引入了 Loop Copilot,一个试图满足音乐创作中迭代细化需求的系统。Loop Copilot 利用大型语言模型 (LLM) 来协调多个专用 AI 模型,使用户能够通过对话界面交互式地生成和细化音乐。该系统的核心是全局属性表 (Global Attribute Table),它在整个迭代过程中记录并维护关键的音乐属性,确保任何阶段的修改都能保持音乐的整体连贯性。尽管 Loop Copilot 在编排音乐创作过程方面表现出色,但它并未直接解决对生成内容进行详细编辑的需求。为了克服这一局限性,我们提出了 MusicMagus 作为编辑 AI 生成音乐的进一步解决方案。MusicMagus 引入了一种零样本文本到音乐编辑方法,允许在无需重新训练的情况下修改特定的音乐属性,如流派、情绪和乐器编排。通过操纵预训练扩散模型内的潜在空间,MusicMagus 确保这些编辑在风格上连贯,且非目标属性保持不变。该系统在编辑过程中维持音乐的结构完整性方面尤为有效,但在处理更复杂和真实的音频场景时遇到了挑战。
引用
@article{arxiv.2411.12641,
title = {Improving Controllability and Editability for Pretrained Text-to-Music Generation Models},
author = {Yixiao Zhang},
journal= {arXiv preprint arXiv:2411.12641},
year = {2024}
}
备注
PhD Thesis