用于音乐流派分类的一维CNN架构
声音
2021-05-18 v1 音频与语音处理
摘要
本文提出了一种用于音乐流派分类的一维残差卷积神经网络(CNN)架构,并与其他近期的一维CNN架构进行比较。一维CNN直接从原始音频信号中学习表征与判别器。若干卷积层捕捉音频信号的时频特征并学习与音乐流派识别任务相关的各种滤波器。所提方法使用滑动窗口将音频信号分割为重叠片段,以满足一维CNN固定长度输入的约束。因此,音乐流派分类可在单个音频片段上进行,也可在多个音频片段预测结果的聚合上进行,从而提高了最终准确率。所提一维残差CNN在包含1000个音频片段的公开数据集上进行了评估。实验结果表明,其音乐流派分类平均准确率达80.93%,优于其他一维CNN架构。
引用
@article{arxiv.2105.07302,
title = {1D CNN Architectures for Music Genre Classification},
author = {Safaa Allamy and Alessandro Lameiras Koerich},
journal= {arXiv preprint arXiv:2105.07302},
year = {2021}
}
备注
6 pages