用于声学场景分类的低复杂度深度学习框架
声音
2022-06-14 v1 机器学习
音频与语音处理
摘要
在本报告中,我们提出了用于声学场景分类(ASC)的低复杂度深度学习框架。所提框架可分为四个主要步骤:前端谱图提取、在线数据增强、后端分类以及预测概率的后期融合。具体而言,我们先将音频记录转换为 Mel、Gammatone 与 CQT 谱图。接着,在送入基于深度学习的分类器前,应用随机裁剪、Specaugment 与 Mixup 等数据增强方法生成增强谱图。最后,为获得最佳性能,我们将三个独立训练于三类谱图的分类器所得概率进行融合。在 DCASE 2022 Task 1 开发集上的实验满足了低复杂度要求,并取得 60.1% 的最佳分类准确率,较 DCASE 基线提升 17.2%。
引用
@article{arxiv.2206.06057,
title = {Low-complexity deep learning frameworks for acoustic scene classification},
author = {Lam Pham and Dat Ngo and Anahid Jalali and Alexander Schindler},
journal= {arXiv preprint arXiv:2206.06057},
year = {2022}
}