可解释的视听地理定位感知与推理
计算机视觉与模式识别
2026-03-09 v1
摘要
尽管多模态大语言模型的最新进展提升了基于图像的定位能力,但由于视觉景观固有的模糊性以及听觉线索的巨大潜力尚未被充分挖掘,精确的全球地理定位仍然是一项艰巨的挑战。本文引入了视听地理定位框架,旨在通过可解释的感知与推理来解决地理模糊性问题。我们提出了AVG,一个高质量、全球尺度的视频地理定位基准,包含跨越1000个不同地点的20000个精选片段。为应对视听地理定位的复杂性,我们提出了一个三阶段框架:(1) 感知阶段,利用混合自回归稀疏自编码器将嘈杂音频分解为具有语义基础的“声学原子”;(2) 多模态推理阶段,采用通过组相对策略优化微调的多模态大语言模型,将这些原子与视觉特征进行综合;(3) 精确预测阶段,在流形上使用黎曼流匹配。我们的实验表明,该框架显著优于单模态基线。这些结果意味着,对声景的可解释感知提供了一个关键的、正交的信号,当与多模态推理相结合时,能够实现高精度的全球定位。
引用
@article{arxiv.2603.05708,
title = {Interpretable Perception and Reasoning for Audiovisual Geolocation},
author = {Yiyang Su and Xiaoming Liu},
journal= {arXiv preprint arXiv:2603.05708},
year = {2026}
}