中文

利用混响和视觉深度线索进行带距离估计的声音事件定位与检测

音频与语音处理 2024-10-30 v1 人工智能 图像与视频处理 信号处理

摘要

本报告描述了我们为 DCASE2024 Task 3 挑战赛提交的系统:带源距离估计的音频和视听声音事件定位与检测(Track B)。我们的主要模型基于视听 Conformer,该模型分别处理使用 ResNet50 提取的视频嵌入和使用在 SELD 上预训练的音频编码器提取的音频嵌入。该模型在 STARSS23 数据集的开发集上大幅优于视听基线,将其 DOAE 减半,并将 F1 分数提高了 3 倍以上。我们的第二个系统对 AV-Conformer 的输出进行时间集成。然后,我们使用用于距离估计的特征扩展了模型,例如从全向音频通道提取的直达和混响信号分量,以及从视频帧提取的深度图。虽然新系统将我们先前模型的 RDE 提高了约 3 个百分点,但其 F1 分数较低。这可能是由训练集中很少出现的声音类别造成的,而更复杂的系统未能检测到这些类别,这一点可以通过分析来确定。为了克服这个问题,我们的第四个也是最后一个系统采用了一种集成策略,结合了其他三个系统的预测。在未来的消融实验中,可以测试许多优化系统和训练策略的机会,并可能为这项视听任务实现增量性能提升。

关键词

引用

@article{arxiv.2410.22271,
  title  = {Leveraging Reverberation and Visual Depth Cues for Sound Event Localization and Detection with Distance Estimation},
  author = {Davide Berghi and Philip J. B. Jackson},
  journal= {arXiv preprint arXiv:2410.22271},
  year   = {2024}
}