使用多谱图编码器-解码器框架的鲁棒声学场景分类
声音
2020-02-12 v1 音频与语音处理
摘要
本文提出一种用于声学场景分类(ASC)的编码器-解码器网络模型,ASC 是从音频录音的声学特征中识别其场景的任务。我们在前端使用多个低级谱图特征,并通过训练良好的 CNN-DNN 前端编码器转换为高级特征。然后将高级特征及其组合(通过训练的特征组合器)输入到由随机森林回归、DNN 和专家混合组成的不同解码器模型,用于后端分类。我们报告了广泛的实验,以评估该框架在各种 ASC 数据集上的准确性,包括 LITIS Rouen 和 IEEE AASP 检测与分类声学场景和事件(DCASE)挑战赛的 2016 年任务 1、2017 年任务 1、2018 年任务 1A 与 1B 以及 2019 年任务 1A 与 1B。实验结果突出了两个主要贡献:其一是通过新颖的 C-DNN 架构编码器网络从多谱图输入中提取高级特征的有效方法,其二是所提出的解码器使该框架能在各数据集上取得具竞争力的结果。单一框架对多个不同挑战均具高度竞争力,这一事实表明其执行通用 ASC 任务的鲁棒性。
引用
@article{arxiv.2002.04502,
title = {Robust Acoustic Scene Classification using a Multi-Spectrogram Encoder-Decoder Framework},
author = {Lam Pham and Huy Phan and Truc Nguyen and Ramaswamy Palaniappan and Alfred Mertins and Ian McLoughlin},
journal= {arXiv preprint arXiv:2002.04502},
year = {2020}
}