中文

少样本音乐源分离

声音 2022-05-04 v1 音频与语音处理

摘要

基于深度学习的音乐源分离方法通常局限于模型所训练的乐器类别,且不能泛化到分离未见过的乐器。为此,我们提出一种少样本音乐源分离范式。我们利用目标乐器的少量音频示例来调节一个通用的U-Net源分离模型。我们将一个少样本调节编码器与U-Net联合训练,将音频示例编码为调节向量,通过特征线性调制(feature-wise linear modulation, FiLM)来配置U-Net。我们在MUSDB18和MedleyDB数据集上的真实音乐录音中评估所训练的模型。我们表明,对于已见和未见乐器,我们提出的少样本调节范式均优于基线单热乐器类别调节模型。为将我们方法的范围扩展到更广泛的真实场景,我们还实验了不同的调节示例特征,包括来自不同录音的示例、含多源的示例或负调节示例。

关键词

引用

@article{arxiv.2205.01273,
  title  = {Few-Shot Musical Source Separation},
  author = {Yu Wang and Daniel Stoller and Rachel M. Bittner and Juan Pablo Bello},
  journal= {arXiv preprint arXiv:2205.01273},
  year   = {2022}
}

备注

ICASSP 2022