利用混响和视觉深度线索进行带距离估计的声音事件定位与检测
音频与语音处理
2024-10-30 v1 人工智能
图像与视频处理
信号处理
摘要
本报告描述了我们为 DCASE2024 Task 3 挑战赛提交的系统:带源距离估计的音频和视听声音事件定位与检测(Track B)。我们的主要模型基于视听 Conformer,该模型分别处理使用 ResNet50 提取的视频嵌入和使用在 SELD 上预训练的音频编码器提取的音频嵌入。该模型在 STARSS23 数据集的开发集上大幅优于视听基线,将其 DOAE 减半,并将 F1 分数提高了 3 倍以上。我们的第二个系统对 AV-Conformer 的输出进行时间集成。然后,我们使用用于距离估计的特征扩展了模型,例如从全向音频通道提取的直达和混响信号分量,以及从视频帧提取的深度图。虽然新系统将我们先前模型的 RDE 提高了约 3 个百分点,但其 F1 分数较低。这可能是由训练集中很少出现的声音类别造成的,而更复杂的系统未能检测到这些类别,这一点可以通过分析来确定。为了克服这个问题,我们的第四个也是最后一个系统采用了一种集成策略,结合了其他三个系统的预测。在未来的消融实验中,可以测试许多优化系统和训练策略的机会,并可能为这项视听任务实现增量性能提升。
引用
@article{arxiv.2410.22271,
title = {Leveraging Reverberation and Visual Depth Cues for Sound Event Localization and Detection with Distance Estimation},
author = {Davide Berghi and Philip J. B. Jackson},
journal= {arXiv preprint arXiv:2410.22271},
year = {2024}
}