中文

基于联合嵌入预测架构的零样图音乐 Stem 检索

声音 2025-02-25 v2 人工智能 音频与语音处理

摘要

本文解决了音乐 Stem 检索任务。给定一段混合音乐,任务是在其它 Stem 中检索一个与之搭配的 Stem,即如果将其与输入混合音一起播放会听起来愉悦。为实现此目标,本文引入一种新方法,基于联合嵌入预测架构(Joint-Embedding Predictive Architectures),其中编码器和预测器联合训练,以产生上下文和目标的潜在表示。具体而言,我们设计预测器以可选任意乐器为条件,使模型能够执行零样图 Stem 检索。此外,我们发现使用对比学习预训练编码器可显著提升模型性能。我们使用 MUSDB18 和 MoisesDB 数据集验证了模型的检索性能。我们表明该方法在两个数据集上均显著优于先前的基线,展示了其能够支持更或更少精确(以及可能未出现的)条件。我们还对所学嵌入在节拍跟踪任务上的表现进行了评估,证明它们保留了时间结构和局部信息。

关键词

引用

@article{arxiv.2411.19806,
  title  = {Zero-shot Musical Stem Retrieval with Joint-Embedding Predictive Architectures},
  author = {Alain Riou and Antonin Gagneré and Gaëtan Hadjeres and Stefan Lattner and Geoffroy Peeters},
  journal= {arXiv preprint arXiv:2411.19806},
  year   = {2025}
}

备注

Accepted to the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2025)