中文

深度与浅层学习简单融合的声学场景分类方法

声音 2018-06-29 v2 机器学习 音频与语音处理 机器学习

摘要

过去,声学场景分类(Acoustic Scene Classification)系统基于手工设计的音频特征输入分类器。如今,常见趋势是采用数据驱动技术,例如深度学习,从数据中学习音频表示。本文提出一种由上述两类方法中两种简单融合而成的系统:一种深度学习方法,将对数尺度梅尔谱图输入卷积神经网络;一种特征工程方法,将一组手工特征输入梯度提升机。我们首先表明两种方法在一定程度上提供互补信息。随后,采用简单后期融合策略结合两者。我们在 TUT Acoustic Scenes 2017 数据集上报告了各方法单独及融合系统的分类准确率。所提融合系统优于各单独方法,在评测集上达到 72.8% 分类准确率,较基线系统提升 11.8%。

关键词

引用

@article{arxiv.1806.07506,
  title  = {A Simple Fusion of Deep and Shallow Learning for Acoustic Scene Classification},
  author = {Eduardo Fonseca and Rong Gong and Xavier Serra},
  journal= {arXiv preprint arXiv:1806.07506},
  year   = {2018}
}

备注

accepted to SMC 2018; updated Figure 7, results unchanged