中文

基于数据增强与轻量 ResNet 的低复杂度声学场景分类

音频与语音处理 2023-06-06 v1

摘要

我们呈现一项关于多设备低复杂度声学场景分类(ASC)的工作,即 DCASE2021 挑战赛任务 1 的子任务 A。该子任务聚焦于用低复杂度模型对多设备音频样本分类,需克服两主要困难。首先,音频样本由不同设备录制,样本间存在录制设备不匹配。我们通过一些有效策略降低设备不匹配的负面影响,包括数据增强(如 mix-up、频谱校正、音高偏移)、多块网络结构与通道注意力的使用。其次,模型大小应小于阈值(如 DCASE2021 挑战赛要求的 128 KB)。为满足此条件,我们采用兼具深度可分离卷积与通道注意力的 ResNet 作为骨干网络,并进行模型压缩。综上,我们提出一种使用数据增强与轻量 ResNet 的低复杂度 ASC 方法。在官方开发与评估数据集上评估,我们的方法分别取得 71.6% 和 66.7% 的分类准确率,以及 1.038 和 1.136 的 Log-loss 分数。我们的最终模型大小为 110.3 KB,小于最大值 128 KB。

关键词

引用

@article{arxiv.2306.02054,
  title  = {Low-Complexity Acoustic Scene Classification Using Data Augmentation and Lightweight ResNet},
  author = {Yanxiong Li and Wenchang Cao and Wei Xie and Qisheng Huang and Wenfeng Pang and Qianhua He},
  journal= {arXiv preprint arXiv:2306.02054},
  year   = {2023}
}

备注

5 pages, 5 figures, 4 tables. Accepted for publication in the 16th IEEE International Conference on Signal Processing (IEEE ICSP)