中文

从多个真实世界声学场景中进行城市分类

音频与语音处理 2019-07-30 v2 声音

摘要

大多数声学场景分析工作集中于两个明确定义的任务之一:声学场景分类或声音事件检测。虽然这种任务分离对于问题定义是有用的,但它们固有地忽略了真实世界的一些微妙之处,特别是人类在描述场景时的差异。有些人会描述天气及其中的特征,另一些人会使用如“公园”之类的整体描述词,还有些人会使用诸如城市或名称等唯一标识符。在本文中,我们着手进行自动城市分类的任务,以询问我们能否从一组声学场景中识别出一个城市?在这个问题中,每个城市都有来自多个场景的录音。我们针对这一新颖任务测试了一系列方法,并表明简单的卷积神经网络(CNN)可以达到50%的准确率。这低于相同数据上DCASE 2018 ASC挑战赛中声学场景分类任务的基线。对类别标签进行简单调整,将城市标签与分组场景配对,准确率提升至52%,更接近较简单的场景分类任务。最后,我们还在多任务学习框架中构建了该问题,并达到了56%的准确率,优于上述方法。

关键词

引用

@article{arxiv.1905.00979,
  title  = {City classification from multiple real-world sound scenes},
  author = {Helen L. Bear and Toni Heittola and Annamaria Mesaros and Emmanouil Benetos and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:1905.00979},
  year   = {2019}
}

备注

Accepted to WASPAA 2019