中文

MVANet:用于声音事件定位与检测的多阶段视频注意力网络及源距离估计

音频与语音处理 2024-11-22 v1

摘要

声音事件定位与检测与源距离估计(3D SELD)不仅涉及识别声音类别及其来向方向(DOA),还需预测声源的距离,以提供关于声源位置的完整信息。本文提出一种用于音视频(AV)3D SELD 的多阶段视频注意力网络(MVANet)。使用多阶段音频特征来自适应捕捉视频中声源的空间信息。我们提出一种新型输出表示方法,通过计算声源的实笛卡尔坐标来结合 DOA 与距离,以解决在 Detection and Classification of Acoustic Scenes and Events(DCASE)2024 挑战中引入的源距离估计(SDE)任务。我们还采用多种有效的数据增强和预训练方法。在 STARSS23 数据集上的实验结果表明,我们所提出的 MVANet 方法有效。通过整合上述技术,我们的系统在 DCASE 2024 挑战中的 AV 3D SELD 任务中超越了所采用的顶级方法,无需模型集成。该代码将在未来公开发布。

关键词

引用

@article{arxiv.2411.14153,
  title  = {MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation},
  author = {Hengyi Hong and Qing Wang and Jun Du and Ruoyu Wei and Mingqi Cai and Xin Fang},
  journal= {arXiv preprint arXiv:2411.14153},
  year   = {2024}
}