中文

基于并行注意力-卷积网络的低复杂度声学场景分类

音频与语音处理 2024-06-13 v1 声音

摘要

本工作是我们提交至 DCASE2023 挑战任务 1 的改进系统。我们提出了一种低复杂度声学场景分类方法,通过并行注意力-卷积网络实现,该网络包含四个模块:预处理、融合、全局和局部上下文信息提取。该提议的网络在捕获每个音频剪辑的全局和局部上下文信息方面具有计算效率。此外,我们将知识蒸馏、数据增强和自适应残差归一化等技术整合到我们的方法中。在在 DCASE2023 挑战的官方数据集上评估时,我们的方法以 56.10% 的最高准确率获得,参数数量为 5.21 千,乘-累积运算量为 144 万。它在准确率和复杂度方面均超过了 DCASE2023 挑战中排名前两名的系统,取得了最新的结果。代码地址: https://github.com/Jessytan/Low-complexity-ASC。

关键词

引用

@article{arxiv.2406.08119,
  title  = {Low-Complexity Acoustic Scene Classification Using Parallel Attention-Convolution Network},
  author = {Yanxiong Li and Jiaxin Tan and Guoqing Chen and Jialong Li and Yongjie Si and Qianhua He},
  journal= {arXiv preprint arXiv:2406.08119},
  year   = {2024}
}

备注

Accepted for publication on Interspeech 2024. 5 pages, 4 figures, 3 tables