用于Mel-频谱图的无训练音乐风格迁移框架——Repurposing Image Diffusion Models
声音
2026-05-14 v4 人工智能
机器学习
音频与语音处理
摘要
音乐风格迁移将源结构与参考风格融合,以实现个性化音乐创作。然而,现有零样本方法往往难以捕获细粒度音频细节,依赖粗糙的文本描述或需要昂贵的任务特定训练。我们提出了Stylus,一个无需训练的框架,通过改造预训练的图像扩散模型实现Mel频谱图上的音乐风格迁移。该方法将音频视为结构化时频图像,通过注入风格键值对自注意力机制进行控制,同时保留源结构查询。为确保高保真度,我们引入相位保留重构策略以缓解频谱图反转伪影,并引入类似分类器自由指南的控制机制以实现可调风格化。广泛的评估包括2925个人类评分表明,Stylus超越了最先进的基线方法,实现了34.1%的内容保留提升和25.7%的感知质量改善。我们的工作验证了通用图像先验如何有效应用于结构化Mel频谱图的无训练转换。代码与材料可在https://github.com/Sooyyoungg/Stylus.git获取。
引用
@article{arxiv.2411.15913,
title = {Repurposing Image Diffusion Models for Training-Free Music Style Transfer on Mel-spectrograms},
author = {Heehwan Wang and Joonwoo Kwon and Sooyoung Kim and Jungwoo Seo and Shinjae Yoo and Yuewei Lin and Jiook Cha},
journal= {arXiv preprint arXiv:2411.15913},
year = {2026}
}
备注
Accepted by ICIP 2026