评估面向音乐 genre 分类的预训练通用音频表示
音频与语音处理
2026-03-17 v1
摘要
本研究探讨了自监督学习嵌入(尤其是 BYOL-A)结合深度神经网络分类器用于音乐 genre 分类的应用。我们的实验表明,BYOL-A 嵌入在 GTZAN 数据集上达到 81.5% 准确率,在 FMA-Small 上达到 64.3% 准确率,优于 PANNs 和 VGGish 等其他预训练模型。 proposed DNN 分类器相较于线性分类器提升了 10-16% 的性能。我们探讨了对比损失、triplet loss 以及带优化损失权重的多任务训练的效果,实现最高准确率。为解决跨数据集挑战,我们将 GTZAN 和 FMA-Small 合并为统一的 18 类标签空间进行联合训练,虽在 GTZAN 上略有性能下降,但在 FMA-Small 上保持相当水平。本工作开发的脚本已公开获取。
引用
@article{arxiv.2603.13871,
title = {Evaluating Pretrained General-Purpose Audio Representations for Music Genre Classification},
author = {Kashish Rai and Mrinmoy Bhattacharjee},
journal= {arXiv preprint arXiv:2603.13871},
year = {2026}
}
备注
Accepted and presented at the International Conference on Pattern Recognition and Machine Intelligence (PReMI), 2025