利用预训练自编码器进行音乐音频的可解释原型学习
声音
2024-02-15 v1 人工智能
多媒体
音频与语音处理
摘要
我们提出了 PECMAE,一种基于原型学习的可解释音乐音频分类模型。我们的模型基于先前的方法 APNet,该方法联合学习自编码器和原型网络。相反,我们提议将这两个训练过程解耦。这使我们能够利用在更大数据集上预训练的现有自监督自编码器(EnCodecMAE),从而提供具有更好泛化能力的表示。APNet 允许将原型重建为波形以实现可解释性,但这依赖于最近的训练数据样本。相比之下,我们探索使用扩散解码器,使其能够在不依赖此类样本的情况下进行重建。我们在乐器分类数据集(Medley-Solos-DB)和流派识别数据集(GTZAN 和一个更大的内部数据集)上评估了我们的方法,后者是一项更具挑战性的任务,此前尚未通过原型网络解决。我们发现,基于原型的模型保留了自编码器嵌入所实现的大部分性能,而原型的声学化有助于理解分类器的行为。
引用
@article{arxiv.2402.09318,
title = {Leveraging Pre-Trained Autoencoders for Interpretable Prototype Learning of Music Audio},
author = {Pablo Alonso-Jiménez and Leonardo Pepino and Roser Batlle-Roca and Pablo Zinemanas and Dmitry Bogdanov and Xavier Serra and Martín Rocamora},
journal= {arXiv preprint arXiv:2402.09318},
year = {2024}
}