基于两阶段分类与数据增强的设备鲁棒声学场景分类
音频与语音处理
2020-08-28 v2 机器学习
声音
摘要
在本技术报告中,我们展示了 GT、USTC、腾讯和 UKE 四个小组的联合工作,以应对 DCASE 2020 挑战中的任务 1——声学场景分类(ASC)。任务 1 包含两个不同子任务:(i) 任务 1a 聚焦于将多种(真实与模拟)设备录制的音频信号分类为十个不同的细粒度类别;(ii) 任务 1b 关注使用低复杂度方案将数据分类为三个更高层级的类别。针对任务 1a,我们提出了一种新颖的两阶段 ASC 系统,利用两个卷积神经网络(CNN)的特设分数组合,分别先将声学输入分为三类,再分为十类。我们探索了四种不同的基于 CNN 的架构来实现两阶段分类器,并研究了若干数据增强技术。针对任务 1b,我们利用量化方法来降低我们两种高精度三类基于 CNN 架构的复杂度。在任务 1a 开发数据集上,使用我们最佳单一分类器与数据增强取得了 76.9\% 的 ASC 准确率;随后通过我们两阶段 ASC 分类器的最终模型融合取得了 81.9\% 的准确率。在任务 1b 开发数据集上,我们以小于 500KB 的模型大小取得了 96.7\% 的准确率。代码见:https://github.com/MihawkHu/DCASE2020_task1。
引用
@article{arxiv.2007.08389,
title = {Device-Robust Acoustic Scene Classification Based on Two-Stage Categorization and Data Augmentation},
author = {Hu Hu and Chao-Han Huck Yang and Xianjun Xia and Xue Bai and Xin Tang and Yajian Wang and Shutong Niu and Li Chai and Juanjuan Li and Hongning Zhu and Feng Bao and Yuanjun Zhao and Sabato Marco Siniscalchi and Yannan Wang and Jun Du and Chin-Hui Lee},
journal= {arXiv preprint arXiv:2007.08389},
year = {2020}
}
备注
Revised Technical Report. Proposed systems attain 2nds in both Task-1a and Task-1b in the official DCASE challenge 2020