中文

OpenCity3D:视觉语言模型对城市环境了解多少

计算机视觉与模式识别 2025-03-24 v1

摘要

视觉语言模型(VLMs)在 3D 场景理解方面展现出巨大潜力,但主要应用于室内空间或自动驾驶领域,聚焦于分割等低层次任务。本工作通过利用来自多视图航空图像的 3D 重建,扩展了其应用至城市尺度环境。我们提出 OpenCity3D,一种解决高层次任务(如人口密度估计、建筑年龄分类、财产价格预测、犯罪率评估和噪声污染评估)的方法。我们的发现突显了 OpenCity3D 在零样本和少样本情境中的强大能力,展示了其对新情境的适应性。这项研究确立了一种新的语言驱动城市分析范式,使其能够应用于规划、政策和环境监测。详情请参阅我们的项目页面:opencity3d.github.io

关键词

引用

@article{arxiv.2503.16776,
  title  = {OpenCity3D: What do Vision-Language Models know about Urban Environments?},
  author = {Valentin Bieri and Marco Zamboni and Nicolas S. Blumer and Qingxuan Chen and Francis Engelmann},
  journal= {arXiv preprint arXiv:2503.16776},
  year   = {2025}
}

备注

Published at WACV 2025