从街景到视觉网络:利用视觉语言模型映射城市地标的可见性
计算机视觉与模式识别
2026-05-15 v3
摘要
城市规划中的可见性分析传统上依赖于视线(LoS)模拟,这些方法捕捉几何遮挡。然而,这些方法依赖于准确的3D数据,而这些数据常常不可得,并且可能不充分地代表视觉上突出的城市地标在真实街景中如何被遇到。我们将地标可见性评估重新表述为图像空间中的城市视觉搜索问题,利用街景图像(SVI)的广泛可用性。给定一个目标地标的参考图像,应用视觉语言模型(VLM)来检测受方向和缩放控制的SVI中的地标。成功的检测表示机器在相应视角处识别到的地标可见性。除了孤立视角,我们构建了一个异构可见性图来表示地标、街景位置以及它们之间以及调节它们的城市空间之间的视觉连通性。这一图使我们能够映射视觉连接发生的位置、它们的强度,以及多个地标如何通过共享视觉走廊变得联合连通。在全球六个著名地标结构上,基于图像的方法实现了87%的整体检测准确率,对地标可见位置的精确率为68%。在伦敦泰晤士河的第二个案例研究中,可见性图揭示了多地标连接并识别了关键调节位置,其中桥梁约占所有连接的31%。该方法补充了基于LoS的可见性分析,为数据受限环境提供了实用替代方案。它还展示了揭示城市环境中视觉对象常见连接的可能性,为城市规划和文化遗产保护开辟了新的视角。
引用
@article{arxiv.2505.11809,
title = {From Street View to Visual Network: Mapping the Visibility of Urban Landmarks with Vision-Language Models},
author = {Zicheng Fan and Kunihiko Fujiwara and Pengyuan Liu and Fan Zhang and Filip Biljecki},
journal= {arXiv preprint arXiv:2505.11809},
year = {2026}
}