中文

深度空间可分离蒸馏用于轻量级声学场景分类

声音 2024-05-07 v1 人工智能 音频与语音处理

摘要

声学场景分类(ASC)在现实世界中非常重要。近年来,基于深度学习的方法被广泛用于声学场景分类。然而,这些方法目前还不够轻量,且性能也不令人满意。为了解决这些问题,我们提出了一种深度空间可分离蒸馏网络。首先,该网络对log-mel频谱图进行高低频分解,在保持模型性能的同时显著降低计算复杂度。其次,我们专门为ASC设计了三种轻量级算子,包括可分离卷积(SC)、正交可分离卷积(OSC)和可分离部分卷积(SPC)。这些算子在声学场景分类任务中表现出高效的特征提取能力。实验结果表明,与当前流行的深度学习方法相比,所提出的方法获得了9.8%的性能提升,同时具有更少的参数数量和计算复杂度。

关键词

引用

@article{arxiv.2405.03567,
  title  = {Deep Space Separable Distillation for Lightweight Acoustic Scene Classification},
  author = {ShuQi Ye and Yuan Tian},
  journal= {arXiv preprint arXiv:2405.03567},
  year   = {2024}
}