中文

基于一维 CNN 并通过降低层间维度的声学场景分类

音频与语音处理 2022-04-04 v1 机器学习 声音

摘要

本文提出了一种用于声学场景分类(ASC)的、相对于常用时频表示的替代表示框架。原始音频信号使用预训练的卷积神经网络(CNN)通过其各个中间层来表示。该研究假设从中间层获得的表示本质上位于低维空间。为获得低维嵌入,进行了主成分分析,并且研究分析表明仅有少数主成分显著。然而,显著成分的适当数量未知。为此,利用了自动字典学习框架来逼近底层子空间。此外,在低维嵌入以集成框架中的后期融合方式聚合,以纳入在各中间层学习的层次信息。实验评估在公开可用的 DCASE 2017 和 2018 ASC 数据集上基于预训练的一维 CNN SoundNet 进行。经验上观察到,较深层比其他层显示出更高的压缩比。在不同数据集上 70% 压缩比时,性能与不进行任何降维时相似。所提框架优于基于时频表示的方法。

关键词

引用

@article{arxiv.2204.00555,
  title  = {1-D CNN based Acoustic Scene Classification via Reducing Layer-wise Dimensionality},
  author = {Arshdeep Singh},
  journal= {arXiv preprint arXiv:2204.00555},
  year   = {2022}
}

备注

No comments