基于矢量量化源类别估计的自监督音乐源分离
声音
2023-11-23 v1 音频与语音处理
摘要
音乐源分离致力于从复合音轨中提取不同的声音元素。历史上许多方法基于监督学习,需要标注数据,其多样性有时受限。较新方法探索了利用一个或多个音频样本辅助分离的N-shot技术。然而,部分方法的一个挑战是推理时需要音频查询,使其不太适合音色与效果多变的流派。本文给出了一种自监督音乐源分离系统的概念验证,该系统在推理时无需音频查询。在训练阶段,虽采用基于查询的方法,我们引入一项修改:用矢量量化(VQ)表示替代查询音频的连续嵌入。以VQ码本大小决定的最多N类进行端到端训练,模型旨在有效分类乐器类别。推理时,输入被划分为N个源,部分可能根据混音的乐器构成未被利用。该方法为跨不同音乐流派的源分离考量提供了替代途径。我们在线提供了示例与额外结果。
引用
@article{arxiv.2311.13058,
title = {Self-Supervised Music Source Separation Using Vector-Quantized Source Category Estimates},
author = {Marco Pasini and Stefan Lattner and George Fazekas},
journal= {arXiv preprint arXiv:2311.13058},
year = {2023}
}
备注
4 pages, 2 figures, 1 table; Accepted at the 37th Conference on Neural Information Processing Systems (2023), Machine Learning for Audio Workshop