GeoProg3D:面向城市规模 3D 语言场的组合化视觉推理
计算机视觉与模式识别
2025-07-01 v1
摘要
3D 语言场的发展使得通过自然语言与 3D 场景进行直观交互成为可能。然而,现有方法通常仅限于小规模环境,缺乏应用于大型复杂城市环境所必需的可扩展性和组合推理能力。为克服这些限制,我们提出了 GeoProg3D,一个实现自然语言驱动与城市规模高保真 3D 场景交互的视觉编程框架。GeoProg3D 包含两个关键组件:(i) 面向城市的 3D 语言场 (GCLF),它利用高效的分层 3D 模型处理大规模数据,并集成地理信息,通过方向线索、距离测量、海拔数据和地标参考实现对庞大城市空间的高效过滤;(ii) 地理视觉 API (GV-APIs),即一类专业化的地理视觉工具,如区域分割和目标检测。我们的框架运用大语言模型 (LLM) 作为推理引擎,动态组合 GV-APIs 并操作 GCLF,从而有效支持多样化的地理视觉任务。为评估城市规模推理性能,我们引入 GeoEval3D,一个包含 952 对查询-答案对的综合性基准数据集,覆盖五个具有挑战性的任务:定位、空间推理、比较、计数和测量。实验表明,GeoProg3D 在多个任务上均显著优于现有的 3D 语言场和视觉-语言模型。据我们所知,GeoProg3D 是首个通过自然语言实现在高保真城市规模 3D 环境中进行组合化地理推理的框架。代码已公开于 https://snskysk.github.io/GeoProg3D/。
引用
@article{arxiv.2506.23352,
title = {GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields},
author = {Shunsuke Yasuki and Taiki Miyanishi and Nakamasa Inoue and Shuhei Kurita and Koya Sakamoto and Daichi Azuma and Masato Taki and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2506.23352},
year = {2025}
}
备注
Accepted by ICCV 2025