中文

用于声学场景分类的多维基于边的音频事件关系图表示学习

音频与语音处理 2022-11-03 v2 声音

摘要

现有的大多数基于深度学习的声学场景分类(ASC)方法直接利用从频谱图中提取的表示来识别目标场景。然而,这些方法很少关注场景中发生的音频事件,尽管它们提供了关键的语义信息。本文首次研究了是否仅基于描述有限数量音频事件的特征就能可靠地识别现实生活中的声学场景。为了建模粗粒度声学场景与细粒度音频事件之间的任务特定关系,我们提出了一种用于 ASC 的事件关系图表示学习(ERGL)框架。具体来说,ERGL 从输入音频中学习声学场景的图表示,其中每个事件的嵌入被视为一个节点,而源自每对事件嵌入的关系线索则由学习到的多维边特征来描述。在多音声学场景数据集上的实验表明,所提出的 ERGL 仅使用有限数量的音频事件嵌入,无需任何数据增强,就在 ASC 上取得了有竞争力的性能。所提出的 ERGL 框架的有效性证明了基于事件关系图识别多样化声学场景的可行性。我们的代码可在我们的主页(https://github.com/Yuanbo2020/ERGL)获取。

关键词

引用

@article{arxiv.2210.15366,
  title  = {Multi-dimensional Edge-based Audio Event Relational Graph Representation Learning for Acoustic Scene Classification},
  author = {Yuanbo Hou and Siyang Song and Chuang Yu and Yuxin Song and Wenwu Wang and Dick Botteldooren},
  journal= {arXiv preprint arXiv:2210.15366},
  year   = {2022}
}