音乐体系分类:经典机器学习与深度学习方法的比较分析
声音
2026-03-17 v1 人工智能
音频与语音处理
摘要
自动音乐体系分类是音乐信息检索 (MIR) 中的长期存在的挑战;针对非西方音乐传统的工作仍寥寥无数。尼泊尔音乐包含丰富且声学多样化的体系——从Lok Dohori的呼唤-响应二重奏,到Deuda的节奏诗歌,再到Tamang Selo独特的旋律——这些都未被现有分类系统所覆盖。在本文中,我们构建了一个约8,000个标记的30秒音频剪辑的数据集,覆盖尼泊尔的八种音乐体系,并系统比较了九种分类模型的性能。五种经典机器学习分类器(Logistic回归、SVM、KNN、随机森林和XGBoost)在通过Librosa提取的51个手工特征上进行训练,而四种深度学习架构(CNN、RNN、并联CNN-RNN和顺序CNN后接RNN)则在640×128的Mel频谱图上运行。我们的实验表明,顺序卷积循环神经网络(CRNN)——即卷积层输入到LSTM中的网络——达到了84%的最高准确率,显著优于最佳经典模型(Logistic回归和XGBoost,均为71%)以及所有其他深度架构。我们提供每个类别的精确率、召回率、F1分数、混淆矩阵和ROC分析,并就误分类模式提供文化背景解释,这反映了尼泊尔音乐传统中真实的重叠。
引用
@article{arxiv.2603.15440,
title = {Music Genre Classification: A Comparative Analysis of Classical Machine Learning and Deep Learning Approaches},
author = {Sachin Prajuli and Abhishek Karna and OmPrakash Dhakl},
journal= {arXiv preprint arXiv:2603.15440},
year = {2026}
}
备注
8 pages