中文

融合空间与语义嵌入用于视频中的立体声事件定位

音频与语音处理 2025-09-09 v1 人工智能 机器学习 图像与视频处理 信号处理

摘要

本研究针对视频内容中的立体声事件定位与检测任务(包括声源距离估计,即3D SELD)进行了方法探讨。3D SELD是一项复杂任务,综合了时间事件分类与空间定位,要求对空间、时间和语义维度进行推理,其中语义维度可能是最具挑战性的建模目标。传统的SELD方法通常依赖多通道输入,受限于数据约束,难以从大规模预训练中获益。为此,我们通过整合预训练的、对比学习对齐的模型来增强标准SELD架构:分别采用CLAP用于音频输入、OWL-ViT用于视觉输入。这些嵌入被整合到我们专为多模态融合设计的修改版Conformer模块中,称为Cross-Modal Conformer。我们对DCASE2025 Task3 Stereo SELD数据集开发集上的消融研究评估了语言对齐模型各自贡献,并与DCASE Task 3基线系统进行基准测试。此外,我们详细阐述了用于模型预训练的大规模合成音频和音视频数据集的构建过程。这些数据集通过左右声道交换数据增强方式得到扩展。我们的方法结合了大规模预训练、模型集成和视觉后处理,最终在DCASE 2025挑战赛Task 3(Track B)中获得第二名,凸显了该方法的有效性。未来工作将探索不同模态的贡献及网络结构的优化。

关键词

引用

@article{arxiv.2509.06598,
  title  = {Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos},
  author = {Davide Berghi and Philip J. B. Jackson},
  journal= {arXiv preprint arXiv:2509.06598},
  year   = {2025}
}

备注

arXiv admin note: substantial text overlap with arXiv:2507.04845