基于数据增强与轻量 ResNet 的低复杂度声学场景分类
音频与语音处理
2023-06-06 v1
摘要
我们呈现一项关于多设备低复杂度声学场景分类(ASC)的工作,即 DCASE2021 挑战赛任务 1 的子任务 A。该子任务聚焦于用低复杂度模型对多设备音频样本分类,需克服两主要困难。首先,音频样本由不同设备录制,样本间存在录制设备不匹配。我们通过一些有效策略降低设备不匹配的负面影响,包括数据增强(如 mix-up、频谱校正、音高偏移)、多块网络结构与通道注意力的使用。其次,模型大小应小于阈值(如 DCASE2021 挑战赛要求的 128 KB)。为满足此条件,我们采用兼具深度可分离卷积与通道注意力的 ResNet 作为骨干网络,并进行模型压缩。综上,我们提出一种使用数据增强与轻量 ResNet 的低复杂度 ASC 方法。在官方开发与评估数据集上评估,我们的方法分别取得 71.6% 和 66.7% 的分类准确率,以及 1.038 和 1.136 的 Log-loss 分数。我们的最终模型大小为 110.3 KB,小于最大值 128 KB。
引用
@article{arxiv.2306.02054,
title = {Low-Complexity Acoustic Scene Classification Using Data Augmentation and Lightweight ResNet},
author = {Yanxiong Li and Wenchang Cao and Wei Xie and Qisheng Huang and Wenfeng Pang and Qianhua He},
journal= {arXiv preprint arXiv:2306.02054},
year = {2023}
}
备注
5 pages, 5 figures, 4 tables. Accepted for publication in the 16th IEEE International Conference on Signal Processing (IEEE ICSP)