中文

FloodVision:基于基础视觉语言模型与领域知识图的城市洪水深度估计

计算机视觉与模式识别 2025-09-08 v1 人工智能

摘要

及时准确地进行洪水深度估计对于道路通行和应急响应至关重要。尽管最近的计算机视觉方法已经能够进行洪水检测,但由于依赖于固定目标检测器和特定任务训练,它们在准确性和泛化能力上均存在局限。为了实现能够泛化至各种洪水场景的准确深度估计,本文提出了 FloodVision,这是一个零样本框架,结合了基础视觉语言模型 GPT-4o 的语义推理能力和结构化的领域知识图。该知识图编码了常见城市物体(包括车辆、行人和基础设施元素)的规范真实世界尺寸,从而将模型的推理建立在物理现实之上。FloodVision 动态识别 RGB 图像中可见的参考物体,从知识图中检索已验证的高度以缓解幻觉,估计淹没比例,并应用统计异常值过滤来计算最终深度值。在来自 MyCoast New York 的 110 张众包图像上进行评估,FloodVision 实现了 8.17 cm 的平均绝对误差,将 GPT-4o 基线 10.28 cm 降低了 20.5%,并超越了以往基于 CNN 的方法。该系统在不同场景下均具有良好的泛化能力,并能在近实时下运行,使其适合未来集成到数字孪生平台和智慧城市洪水韧性的市民报告应用中。

关键词

引用

@article{arxiv.2509.04772,
  title  = {FloodVision: Urban Flood Depth Estimation Using Foundation Vision-Language Models and Domain Knowledge Graph},
  author = {Zhangding Liu and Neda Mohammadi and John E. Taylor},
  journal= {arXiv preprint arXiv:2509.04772},
  year   = {2025}
}