中文

基于模式识别的音频处理用于音乐流派分类

声音 2024-10-22 v1 机器学习 音频与语音处理

摘要

本项目探索了使用机器学习技术对 GTZAN 数据集进行音乐流派分类的应用,该数据集包含每个流派 100 个音频文件。我们聚焦于对五种流派——蓝调、古典、爵士、嘻哈和乡村——进行分类,使用包括 Logistic 回归、K 近邻 (KNN)、随机森林和人工神经网络 (ANN) 在内的多种算法,通过 Keras 实现。ANN 模型表现最佳,达到 92.44% 的验证准确率。我们还分析了关键音频特征,如谱滚降、谱质心和 MFCC,这些特征有助于提高模型的准确率。未来工作将扩展模型覆盖全部十个流派,探索更高级的方法如长短期记忆 (LSTM) 网络和集成方法,以及开发用于实时流派分类和播放列表生成的 web 应用程序。本研究旨在通过提高音乐推荐系统和内容策划来作出贡献。

关键词

引用

@article{arxiv.2410.14990,
  title  = {Audio Processing using Pattern Recognition for Music Genre Classification},
  author = {Sivangi Chatterjee and Srishti Ganguly and Avik Bose and Hrithik Raj Prasad and Arijit Ghosal},
  journal= {arXiv preprint arXiv:2410.14990},
  year   = {2024}
}