一种面向设备鲁棒声学场景分类的两阶段方法
声音
2021-10-11 v1 人工智能
机器学习
神经与进化计算
音频与语音处理
摘要
为提升设备鲁棒性——这一极具竞争力的数据驱动声学场景分类(ASC)系统的关键特征,本文提出一种基于全卷积神经网络(CNN)的新型两阶段系统。我们的两阶段系统利用基于两个 CNN 分类器的特定分数组合:(i)第一个 CNN 将声学输入分类为三个宽泛类别之一,(ii)第二个 CNN 将相同输入分类为十个细粒度类别之一。我们探索了三种不同的 CNN 架构来实现两阶段分类器,并研究了一种频率子采样方案。此外,还探讨了用于 ASC 的新型数据增强方案。在 DCASE 2020 Task 1a 上评估,我们的结果表明所提出的 ASC 系统在开发集上达到了最先进的准确率,其中我们的最佳系统(CNN 集成体的两阶段融合)在多设备测试数据中取得了 81.9% 的平均准确率,并在未见过设备上获得显著提升。最后,基于类激活映射(CAM)的神经显著性分析为我们模型所学模式提供了新的见解。
引用
@article{arxiv.2011.01447,
title = {A Two-Stage Approach to Device-Robust Acoustic Scene Classification},
author = {Hu Hu and Chao-Han Huck Yang and Xianjun Xia and Xue Bai and Xin Tang and Yajian Wang and Shutong Niu and Li Chai and Juanjuan Li and Hongning Zhu and Feng Bao and Yuanjun Zhao and Sabato Marco Siniscalchi and Yannan Wang and Jun Du and Chin-Hui Lee},
journal= {arXiv preprint arXiv:2011.01447},
year = {2021}
}
备注
Submitted to ICASSP 2021. Code available: https://github.com/MihawkHu/DCASE2020_task1