SpectNet:使用可学习谱图进行端到端音频信号分类
音频与语音处理
2022-11-18 v1 声音
信号处理
摘要
音频信号模式识别是一个活跃的研究课题,涵盖音频标注、声学场景分类、音乐分类及其他领域。谱图与梅尔频率倒谱系数(MFCC)是音频信号分析与分类中最常用的特征之一。近来,深度卷积神经网络(CNN)已成功用于基于谱图的二维特征的音频分类问题。本文中,我们提出SpectNet,一种在CNN架构内提取谱图特征的集成前端层,可用于音频模式识别任务。该前端层利用以梅尔尺度滤波器初始化的可学习伽马通滤波器。所提层输出二维谱图图像,可送入二维CNN进行分类。包括前端滤波器组在内的整个网络参数均可通过反向传播更新。该训练方案允许依据目标音频数据集微调谱图图像特征。所提方法在两个不同音频信号分类任务中评估:心音异常检测与声学场景分类。相比经典谱图图像特征,所提方法在心音分类任务中MACC显著提升1.02%,在声学场景分类任务中准确率显著提升2.11%。我们的实验源代码见 \url{https://github.com/mHealthBuet/SpectNet}
引用
@article{arxiv.2211.09352,
title = {SpectNet : End-to-End Audio Signal Classification Using Learnable Spectrograms},
author = {Md. Istiaq Ansari and Taufiq Hasan},
journal= {arXiv preprint arXiv:2211.09352},
year = {2022}
}