SwG-former:一种用于声音事件定位与检测中时空信息同步提取的滑动窗口图卷积网络
音频与语音处理
2024-03-21 v3
摘要
声音事件定位与检测(SELD)包含声音事件检测(SED)和到达方向(DoA)估计任务。SED 主要依赖时间依赖性来区分不同声音类别,而 DoA 估计则依赖空间相关性来估计声源方向。本文针对音频信号中同步提取时空信息以提升 SELD 性能的需求展开研究。设计了一种新颖的模块——滑动窗口图former(SwG-former),以基于声音事件的空间相关性学习其时间上下文信息。SwG-former 模块将音频信号转换为图表示,并构建图顶点以捕获更高抽象层次的空间相关性。它使用不同大小的滑动窗口来适应各种声音事件时长,聚合具有相似空间信息的时间特征,同时引入多头自注意力(MHSA)来建模全局信息。此外,作为消息传递的基石,提出了一种鲁棒的 Conv2dAgg 函数并嵌入该模块中以聚合邻居顶点特征。由此,堆叠 SwG-former 模块得到的 SwG-former 模型展现出优于近期先进 SELD 模型的性能。该 SwG-former 模块还被集成到事件无关网络第二版(EINV2)中,称为 SwG-EINV2,在相同声学环境下超越了当前最优(SOTA)方法。
引用
@article{arxiv.2310.14016,
title = {SwG-former: A Sliding-Window Graph Convolutional Network for Simultaneous Spatial-Temporal Information Extraction in Sound Event Localization and Detection},
author = {Weiming Huang and Qinghua Huang and Liyan Ma and Chuan Wang},
journal= {arXiv preprint arXiv:2310.14016},
year = {2024}
}