时光复调:基于扩散模型的多声部干声风格迁移
声音
2026-05-12 v1 人工智能
摘要
时光迁移旨在修改音乐录音的音色身份,同时保留原始旋律和节奏。虽然单音乐时光迁移取得了显著进展,但现有方法在多音乐场景下依赖分离-迁移管道,会传递源分离伪影并产生不连贯的综合音色。本文提出了 MixtureTT,据称是首个从多声部混合信号直接进行灵活 per-stem 时光迁移的系统。给定混合信号和每个目标音乐的独立时光参考, MixtureTT 通过共享扩散过程将所有声轨传输到指定乐器。模型在 per-stem 内容和跨声轨和声依赖上进行建模,提出的联合声轨扩散转换器消除了级联分离误差,通过等于声轨数量的因子降低推理成本,并产生更连贯的多声轨输出。尽管输入条件更为严苛,但在 SATB 合唱数据集上的评估显示, MixtureTT 在客观和主观指标上均优于单音乐基线,证明了针对混合水平时光迁移而非简单分离-迁移管道的必要性。结果表明,跨声轨建模对于混合水平时光迁移至关重要,该联合设置持续超过等效单声轨 ablation。
引用
@article{arxiv.2605.09259,
title = {Remix the Timbre: Diffusion-Based Style Transfer Across Polyphonic Stems},
author = {Leduo Chen and Junchuan Zhao and Shengchen Li},
journal= {arXiv preprint arXiv:2605.09259},
year = {2026}
}