中文

基于效果嵌入生成模型的自动音乐混音

音频与语音处理 2025-11-12 v1 声音

摘要

音乐混音涉及将单个轨道组合成连贯的混合音,此任务具有主观性,同一输入可产生多个有效解。现有自动混音系统将此任务视为确定性回归问题,因而忽略了这种多解性。本文引入MEGAMI(Multitrack Embedding Generative Auto MIxing),一个生成框架,建模给定未处理轨道后得到专业混音的条件分布。MEGAMI使用基于轨道无关的效果处理器,条件于每个轨道生成的嵌入;通过置换不变结构处理任意无标签轨道;并通过域适应实现对干式和湿式录音的训练。我们的客观评估使用分布指标显示在现有方法上 consistently 改进,而听觉测试表明其性能在不同音乐类型下接近人类水平。

关键词

引用

@article{arxiv.2511.08040,
  title  = {Automatic Music Mixing using a Generative Model of Effect Embeddings},
  author = {Eloi Moliner and Marco A. Martínez-Ramírez and Junghyun Koo and Wei-Hsiang Liao and Kin Wai Cheuk and Joan Serrà and Vesa Välimäki and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2511.08040},
  year   = {2025}
}

备注

submitted to IEEE ICASSP 2026