中文

基于深度卷积神经网络的声学分类中的谱特征与节奏特征

声音 2025-09-16 v2 人工智能 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

卷积神经网络(CNN)在计算机视觉中被广泛使用。它们不仅可以用于识别常规数字图像材料中的模式,还可以从表示声学分类声音的频谱和节奏特征的数字图像中进行特征提取。本研究考察了不同表示形式,如以梅尔比例缩放的频谱图、梅尔频率倒谱系数(MFCCs)、循环时序图、短时傅里叶变换(STFT)色度图、常数-Q变换(CQT)色度图和色度能归一化统计(CENS)色度图,针对使用深度卷积神经网络进行声学分类的性能。研究表明,梅尔比例缩放频谱图和梅尔频率倒谱系数(MFCCs)在本研究中对声学分类任务表现显著优于其他频谱和节奏特征。实验使用包含2000个标记环境音频录音的ESC-50数据集进行。

关键词

引用

@article{arxiv.2410.06927,
  title  = {Spectral and Rhythm Features for Audio Classification with Deep Convolutional Neural Networks},
  author = {Friedrich Wolf-Monheim},
  journal= {arXiv preprint arXiv:2410.06927},
  year   = {2025}
}