通过引导预训练音乐模型的无监督源分离
声音
2021-10-26 v1 机器学习
音频与语音处理
摘要
我们展示了一种无监督方法,该方法将训练用于音乐生成和音乐标记的深度模型重新用于音频源分离,无需任何重新训练。音频生成模型以输入混合信号为条件,产生用于生成音频的音频潜在编码。生成的音频被馈送到预训练的音乐标记器,该标记器生成源标签。生成音频的标签分布与孤立源的预定义分布之间的交叉熵损失用于指导生成模型(不变)潜在空间中的梯度上升。该系统不更新生成模型或标记器的权重,仅依赖于在生成模型的潜在空间中移动以产生分离的源。我们使用OpenAI的Jukebox作为预训练生成模型,并将其与四种预训练音乐标记器(两种架构和两种标记数据集)耦合。在两个源分离数据集上的实验结果表明,这种方法可以为比任何测试的有监督或无监督系统更广泛的源类型产生分离估计。这项工作指出了大型预训练音乐模型在音频到音频任务(如源分离)中的巨大且迄今未开发的潜力。
引用
@article{arxiv.2110.13071,
title = {Unsupervised Source Separation By Steering Pretrained Music Models},
author = {Ethan Manilow and Patrick O'Reilly and Prem Seetharaman and Bryan Pardo},
journal= {arXiv preprint arXiv:2110.13071},
year = {2021}
}
备注
Submitted to ICASSP 2022