中文

Diff-TONE:文本到音乐扩散模型中的时间步优化用于乐器编辑

声音 2025-06-19 v1 机器学习 音频与语音处理 信号处理

摘要

文本到音乐生成模型的突破正在改变创作格局,使音乐家获得前所未有的创新工具进行作曲和实验。然而,要控制生成过程以实现特定的预期结果仍是一个重大挑战。即使在相同的文本提示和随机种子下,微小的变化也会极大地改变生成的作品。本文探索了将现有的文本到音乐扩散模型应用于乐器编辑的可能性。具体而言,针对现有的音频轨道,我们旨在利用预训练的文本到音乐扩散模型来编辑乐器,同时保留其 underlying 内容。基于该模型首先关注音频的整体结构或内容,然后添加乐器信息,最后细化质量的洞见,我们展示,通过选择通过乐器分类器识别的良好选定的中间时间步,可在保留原始作品内容和实现所需音色之间取得平衡。我们的方法无需对文本到音乐扩散模型进行额外训练,也不影响生成过程的速度。

关键词

引用

@article{arxiv.2506.15530,
  title  = {Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models},
  author = {Teysir Baoueb and Xiaoyu Bie and Xi Wang and Gaël Richard},
  journal= {arXiv preprint arXiv:2506.15530},
  year   = {2025}
}