谱特征与节奏特征在深度卷积神经网络下的类别级和类别级音频分类性能评估
声音
2025-09-16 v2 人工智能
计算机视觉与模式识别
机器学习
音频与语音处理
摘要
除了决策树和k近邻算法之外,深度卷积神经网络(CNN)在诸多领域如音乐、语音或环境声音的音频数据分类中广泛应用。为了训练特定的CNN,可使用各种谱特征和节奏特征,如梅度缩放语谱图、梅尔频谱系数(MFCC)、循环时序图、短时傅里叶变换(STFT)色度图、常数-Q变换(CQT)色度图和色度能归一化统计(CENS)色度图作为神经网络的数字图像输入数据。本研究使用深度CNN详细探讨了这些谱和节奏特征在音频类别级及音频类别级分类中的性能,并采用端到端的深度学习管道,对包含2000个标记环境音频录音的ESC-50数据集进行评估。评估指标如准确率、精确率、召回率和F1分数对于多类分类明确显示,梅尔缩放语谱图和梅尔频谱系数(MFCC)在使用深度CNN进行音频分类任务时,性能显著优于其他研究中所考察的谱和节奏特征。
引用
@article{arxiv.2509.07756,
title = {Spectral and Rhythm Feature Performance Evaluation for Category and Class Level Audio Classification with Deep Convolutional Neural Networks},
author = {Friedrich Wolf-Monheim},
journal= {arXiv preprint arXiv:2509.07756},
year = {2025}
}