基于对象感知的音频-视觉场景理解下的声源定位
计算机视觉与模式识别
2025-06-25 v2
摘要
音频-视觉声源定位任务旨在通过整合视觉与音频线索,在视觉场景中对发声对象进行空间定位。然而,现有方法在复杂场景中难以准确定位发声对象,尤其是在视觉上相似的静默对象共存时。这一局限主要源于其依赖简单的时间-视觉对应关系,无法捕捉发声对象与静默对象之间的细粒度语义差异。为解决这些挑战,我们提出一种新颖的声源定位框架,利用多模态大语言模型(MLLM)生成详细的上下文信息,以显式区分发声前景对象与静默背景对象。为有效整合此类信息,我们引入两种新型损失函数:对象感知对比对齐损失(OCA loss)和对象区域隔离损失(ORI loss)。在MUSIC和VGGSound数据集上的大量实验结果表明,我们方法的有效性,在单源和多源定位场景中均显著优于现有方法。代码及生成的详细上下文信息可在:https://github.com/VisualAIKHU/OA-SSL 获取。
引用
@article{arxiv.2506.18557,
title = {Object-aware Sound Source Localization via Audio-Visual Scene Understanding},
author = {Sung Jin Um and Dongjin Kim and Sangmin Lee and Jung Uk Kim},
journal= {arXiv preprint arXiv:2506.18557},
year = {2025}
}
备注
Accepted at CVPR 2025