TF-SepNet:一种用于低复杂度声学场景分类的CNN高效一维核设计
声音
2024-05-30 v4 音频与语音处理
摘要
近期研究聚焦于利用卷积神经网络(CNNs)开发用于声学场景分类(ASC)的高效系统,这类系统通常由连续的卷积核组成。本文强调了在ASC任务中使用分离卷积核作为一种更强大且高效的设计方法的优势。受音频信号时频特性的启发,我们提出了TF-SepNet,一种沿时间和频率维度分离特征处理的CNN架构。来自分离路径的特征随后按通道合并并直接送入分类器。TF-SepNet采用一维(1D)卷积核替代传统的二维(2D)卷积核,以降低计算成本。实验使用TAU Urban Acoustic Scene 2022 Mobile开发数据集进行。结果表明,TF-SepNet优于使用连续卷积核的同类SOTA方法。进一步研究发现,分离卷积核带来了更大的有效感受野(ERF),使TF-SepNet能够捕获更多的时频特征。
引用
@article{arxiv.2309.08200,
title = {TF-SepNet: An Efficient 1D Kernel Design in CNNs for Low-Complexity Acoustic Scene Classification},
author = {Yiqiang Cai and Peihong Zhang and Shengchen Li},
journal= {arXiv preprint arXiv:2309.08200},
year = {2024}
}
备注
Accepted by the 2024 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2024)