基于效果嵌入生成模型的自动音乐混音
音频与语音处理
2025-11-12 v1 声音
摘要
音乐混音涉及将单个轨道组合成连贯的混合音,此任务具有主观性,同一输入可产生多个有效解。现有自动混音系统将此任务视为确定性回归问题,因而忽略了这种多解性。本文引入MEGAMI(Multitrack Embedding Generative Auto MIxing),一个生成框架,建模给定未处理轨道后得到专业混音的条件分布。MEGAMI使用基于轨道无关的效果处理器,条件于每个轨道生成的嵌入;通过置换不变结构处理任意无标签轨道;并通过域适应实现对干式和湿式录音的训练。我们的客观评估使用分布指标显示在现有方法上 consistently 改进,而听觉测试表明其性能在不同音乐类型下接近人类水平。
引用
@article{arxiv.2511.08040,
title = {Automatic Music Mixing using a Generative Model of Effect Embeddings},
author = {Eloi Moliner and Marco A. Martínez-Ramírez and Junghyun Koo and Wei-Hsiang Liao and Kin Wai Cheuk and Joan Serrà and Vesa Välimäki and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2511.08040},
year = {2025}
}
备注
submitted to IEEE ICASSP 2026