中文

基于联合学习模型与多谱图特征的声场景分类

声音 2020-05-27 v1 音频与语音处理

摘要

在本文中,我们提出了一个应用于声场景分类(ASC)的深度学习框架,该任务旨在从环境输入声音中对场景上下文进行分类。一个 ASC 系统通常包括两个主要步骤,即前端特征提取与后端分类。在第一步中,提取器用于从原始音频信号中提取低级特征。接下来,提取出的判别性特征被输入分类器并由其分类,给出准确率结果。为了开发应用于 ASC 的鲁棒框架,我们解决了 ASC 系统中前端与后端组件的现有问题,从而提出了三个主要贡献:首先,我们对从声音场景输入中提取的谱图表示进行了全面分析,进而提出了最佳的多谱图组合。在后端分类方面,我们提出了一种使用并行卷积循环网络的新型联合学习架构,它能有效学习谱图输入的空间特征与时间序列。最后,在 IEEE AASP 声学与事件检测及分类挑战赛(DCASE)2016 任务1、2017 任务1、2018 任务1A 与 1B 以及 LITIS Rouen 等基准数据集上取得的良好实验结果,证明了我们所提框架对 ASC 任务具有通用性与鲁棒性。

关键词

引用

@article{arxiv.2005.12779,
  title  = {Sound Context Classification Basing on Join Learning Model and Multi-Spectrogram Features},
  author = {Dat Ngo and Hao Hoang and Anh Nguyen and Tien Ly and Lam Pham},
  journal= {arXiv preprint arXiv:2005.12779},
  year   = {2020}
}