GeoGuess:基于街景图像层次化视觉信息的多模态推理
计算与语言
2025-09-16 v2 人工智能
多媒体
摘要
多模态推理是理解、整合和跨不同数据模态进行推理的过程。近年来因作为人工智能基准测试而受到广泛关注。尽管已有各种任务用于评估多模态推理能力,但仍存在局限。缺乏对不同层次粒度(如局部细节与全局语境)层次化视觉线索的推理讨论,尽管在实际场景中频繁涉及。为弥合这一差距,我们引入一种新颖且具有挑战性的多模态推理任务,称为 GeoGuess。给定街景图像,任务是识别其位置并提供详细解释。成功的 GeoGuess 系统应能够检测细微视觉线索、感知更广阔的景观,并与广泛的地理知识关联。因此,GeoGuess 需要在层次化视觉信息与地理知识之间进行推理。在本工作中,我们通过引入由全景图-地理坐标-解释数组成的特别精选数据集 GeoExplain 来建立 GeoGuess 框架。此外,我们提出一种多模态多层次推理方法,称为 SightSense,可基于层次化视觉信息和外部知识进行预测和生成综合解释。我们的分析和实验表明,SightSense 在 GeoGuess 中表现出色。
引用
@article{arxiv.2506.16633,
title = {GeoGuess: Multimodal Reasoning based on Hierarchy of Visual Information in Street View},
author = {Fenghua Cheng and Jinxiang Wang and Sen Wang and Zi Huang and Xue Li},
journal= {arXiv preprint arXiv:2506.16633},
year = {2025}
}
备注
Updated version