中文

TF-SepNet:一种用于低复杂度声学场景分类的CNN高效一维核设计

声音 2024-05-30 v4 音频与语音处理

摘要

近期研究聚焦于利用卷积神经网络(CNNs)开发用于声学场景分类(ASC)的高效系统,这类系统通常由连续的卷积核组成。本文强调了在ASC任务中使用分离卷积核作为一种更强大且高效的设计方法的优势。受音频信号时频特性的启发,我们提出了TF-SepNet,一种沿时间和频率维度分离特征处理的CNN架构。来自分离路径的特征随后按通道合并并直接送入分类器。TF-SepNet采用一维(1D)卷积核替代传统的二维(2D)卷积核,以降低计算成本。实验使用TAU Urban Acoustic Scene 2022 Mobile开发数据集进行。结果表明,TF-SepNet优于使用连续卷积核的同类SOTA方法。进一步研究发现,分离卷积核带来了更大的有效感受野(ERF),使TF-SepNet能够捕获更多的时频特征。

关键词

引用

@article{arxiv.2309.08200,
  title  = {TF-SepNet: An Efficient 1D Kernel Design in CNNs for Low-Complexity Acoustic Scene Classification},
  author = {Yiqiang Cai and Peihong Zhang and Shengchen Li},
  journal= {arXiv preprint arXiv:2309.08200},
  year   = {2024}
}

备注

Accepted by the 2024 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2024)