用于声学场景分类的低复杂度 CNN
音频与语音处理
2022-07-26 v1 人工智能
机器学习
声音
摘要
本文提出了一种用于声学场景分类(ASC)的低复杂度框架。大多数针对 ASC 设计的框架都使用卷积神经网络(CNNs),因为相较于手工设计特征,它们具有学习能力和更优的性能。然而,CNNs 由于其庞大的规模和较高的计算复杂度而耗费大量资源。因此,CNNs 难以部署在资源受限的设备上。本文致力于降低 CNNs 中的计算复杂度和内存需求问题。我们提出了一种低复杂度 CNN 架构,并应用剪枝和量化来进一步减少参数和内存。随后我们提出了一种集成框架,结合多种低复杂度 CNN 以提升整体性能。所提框架在专注于 ASC 的公开 DCASE 2022 Task 1 上进行了实验评估。该集成框架约具有 60K 参数,需要 19M 乘加运算,并且相比 DCASE 2022 Task 1 基线网络将性能提升了约 2-4 个百分点。
引用
@article{arxiv.2207.11529,
title = {Low-complexity CNNs for Acoustic Scene Classification},
author = {Arshdeep Singh and Mark D. Plumbley},
journal= {arXiv preprint arXiv:2207.11529},
year = {2022}
}
备注
Submitted to DCASE 2022 Workshop