中文

基于 MLLM 元推理的无训练声源定位:生成、分析、细化

计算机视觉与模式识别 2026-04-09 v1

摘要

声源定位任务旨在通过利用音频与视觉模态之间的相关性来识别声源对象的位置。大多数现有 SSL 方法依赖基于对比学习的特征匹配,但缺乏显式推理和验证,限制了其在复杂声学场景中的效果。灵感来自人类的元认知过程,我们提出一种无训练声源定位框架,利用多模态大语言模型(MLLMs)的内在推理能力。我们的生成-分析-细化(GAR)管道包括三个阶段:生成阶段产生初始边界框和音频分类;分析阶段通过开放集角色标记和锚点投票量化音频-视觉一致性;细化阶段应用自适应门控防止不必要的调整。在单源和多源基准上的大量实验表明方法性能竞争。源代码已公开于 https://github.com/VisualAIKHU/GAR-SSL。

关键词

引用

@article{arxiv.2604.06824,
  title  = {Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning},
  author = {Subin Park and Jung Uk Kim},
  journal= {arXiv preprint arXiv:2604.06824},
  year   = {2026}
}

备注

Accepted to CVPR 2026