中文

基于事件嵌入的关系引导声学场景分类

声音 2022-05-03 v1 音频与语音处理

摘要

在现实生活中,声学场景与音频事件天然相关。人类本能地依赖细粒度音频事件以及整体声音特征来区分多样的声学场景。然而,以往大多数方法将声学场景分类(ASC)与音频事件分类(AEC)视为两个独立任务。少数关于场景与事件联合分类的研究要么使用难以匹配真实世界的合成音频数据集,要么简单地使用多任务框架同时执行两个任务。这两种方式都未充分利用细粒度事件与粗粒度场景之间隐含且固有的关系。为此,本文提出一种关系引导的 ASC(RGASC)模型,以进一步挖掘并协调场景-事件关系,使场景与事件识别互利。TUT Urban Acoustic Scenes 2018 数据集(TUT2018)通过简单高效的音频相关预训练模型 PANN(当前最先进的 AEC 模型之一)标注了事件的伪标签。随后,定义先验场景-事件关系矩阵为每个场景类中各事件类型出现的平均概率。最后,双塔 RGASC 模型在真实数据集 TUT2018 上联合训练以完成场景与事件分类。取得如下结果:1)RGASC 有效协调了粗粒度场景的真实信息与细粒度事件的伪信息;2)在先验场景-事件关系引导下从伪标签学习到的事件嵌入有助于减少相似声学场景间的混淆;3)与其他(非集成)方法相比,RGASC 在真实数据集上提升了场景分类准确率。

关键词

引用

@article{arxiv.2205.00499,
  title  = {Relation-guided acoustic scene classification aided with event embeddings},
  author = {Yuanbo Hou and Bo Kang and Wout Van Hauwermeiren and Dick Botteldooren},
  journal= {arXiv preprint arXiv:2205.00499},
  year   = {2022}
}

备注

International Joint Conference on Neural Networks (IJCNN) 2022