中文

基于大语言模型的音乐流派分类

声音 2024-10-14 v1 计算机视觉与模式识别 音频与语音处理

摘要

本文利用预训练大语言模型(LLMs)的零样本能力进行音乐流派分类。 proposed 方法将音频信号分割为20毫秒的片段,并通过卷积特征编码器、变换器编码器以及额外的层来编码音频单位并生成特征向量。提取的特征向量用于训练分类头。在推理过程中,对 individual 片段上的预测进行聚合,以获得最终的流派分类。我们对比评估了包括 WavLM、HuBERT 和 wav2vec 2.0 在内的多种 LLMs,以及传统的深度学习架构,如 1D 和 2D 卷积神经网络(CNN)和音频频谱变换器(AST)。我们的发现表明,AST 模型表现最佳,在整体准确率上达到 85.5%,超越了评估的所有其他模型。这些结果凸显了即使在零样本场景下,LLMs 和基于变换器的架构也具有推动音乐信息检索任务发展的潜力。

关键词

引用

@article{arxiv.2410.08321,
  title  = {Music Genre Classification using Large Language Models},
  author = {Mohamed El Amine Meguenani and Alceu de Souza Britto and Alessandro Lameiras Koerich},
  journal= {arXiv preprint arXiv:2410.08321},
  year   = {2024}
}

备注

7 pages