中文

压缩四元数卷积神经网络用于音频分类

音频与语音处理 2025-10-27 v1 人工智能 声音 信号处理

摘要

传统的实域卷积神经网络(CNN)在音频分类中广泛应用。然而,它们的卷积操作会独立处理多通道输入,限制了捕获通道间相关性的能力。这可能导致特征学习次优,尤其是对于复杂的音频模式,如多通道频谱表示。四元数卷积神经网络(QCNN)通过采用四元数代数来联合捕获通间依赖性,从而实现更紧凑的模型,参数更少,同时更好地利用音频信号的多维特性。然而,QCNN由于四元数运算的开销,具有更高的计算复杂度,导致推理延迟增加,效率低于传统CNN,给资源受限平台的部署带来挑战。为此,本文探索知识蒸馏(KD)和剪枝,以降低QCNN的计算复杂度,同时保持性能。我们在音频分类实验中发现,剪枝QCNN的性能与知识蒸馏相当或更优,且所需计算 effort 更少。与传统CNN和基于Transformer的架构相比,剪枝QCNN在减少可学习参数数量和计算复杂度的同时,实现了竞争性能。在AudioSet数据集上,剪枝QCNN将计算成本降低50%,参数数量降低80%,同时保持与传统CNN相当的性能。此外,剪枝QCNN在多个音频分类基准测试(包括GTZAN用于音乐 genre 识别、ESC-50用于环境声分类和RAVDESS用于语音情感识别)上都能很好地泛化。

关键词

引用

@article{arxiv.2510.21388,
  title  = {Compressing Quaternion Convolutional Neural Networks for Audio Classification},
  author = {Arshdeep Singh and Vinayak Abrol and Mark D. Plumbley},
  journal= {arXiv preprint arXiv:2510.21388},
  year   = {2025}
}

备注

Under review in IEEE TASLPRO