Melodia:基于注意力探针的无训练音乐编辑
声音
2025-11-19 v3 音频与语音处理
摘要
文本到音乐生成技术正在迅速发展,为音乐创作与编辑带来新机遇。然而,现有音乐编辑方法常在修改特定属性(如乐器、风格或情绪)时未能保留源音乐的时序结构,包括旋律和节奏。为此,本文对注意力图在 AudioLDM 2 内部进行深入探针分析——这是现有音乐编辑方法常用的扩散模型底层。我们发现,跨注意力图包含关于不同音乐特征的细节,干预这些图常导致效果不佳的修改。相比之下,自注意力图在将源音乐转换为目标音乐时对保留时序结构至关重要。基于此认识,我们提出了 Melodia,一种无需训练的技术,通过在去噪过程中操控特定层的自注意力图,并利用注意力仓库存储源音乐信息,从而在无需对源音乐进行文本描述的情况下,实现对音乐特征的精准修改,同时保留原始结构。此外,我们提出了两种新型指标以更好地评估音乐编辑方法。客观与主观实验结果表明,我们的方法在各种数据集上在文本遵循性和结构完整性方面表现优异。该研究增进了对音乐生成模型内部机制的理解,为音乐创作提供了更好的控制手段。
引用
@article{arxiv.2511.08252,
title = {Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion Models},
author = {Yi Yang and Haowen Li and Tianxiang Li and Boyu Cao and Xiaohan Zhang and Liqun Chen and Qi Liu},
journal= {arXiv preprint arXiv:2511.08252},
year = {2025}
}
备注
AAAI 2026 (Oral)