中文

基于社交媒体图像的 LLM 驱动洪水深度估计:面向交通韧性的视觉-语言模型框架及其机制解释

计算机视觉与模式识别 2026-03-25 v2

摘要

城市洪水正成为交通网络连续性日益严峻的威胁,然而目前尚无运营系统能够提供所需分辨率(厘米级)的实时、街道级洪水深度信息,以支持动态路由、电动车(EV)安全以及自动驾驶车(AV)运营。本研究提出了 FloodLlama,一个基于微调的开源视觉-语言模型(VLM),用于从单张街景图像估计连续洪水深度,并配合基于 TikTok 数据的多模态感知管线。生成约 19 万张人工合成图像,涵盖七种车辆类型、四种天气状况和 41 个深度水平(0-40 cm,分辨率为 1 cm)。采用渐进式课程训练实现粗到细学习,利用 QLoRA 对 LLaMA 3.2-11B Vision 进行微调。在 34797 项试验中评估,发现深度依赖的提示效果:简单提示在浅层洪水时表现更佳,而链式思维(CoT)推理在深度洪水时提升更明显。FloodLlama 在深度洪水区域实现均绝对误差(MAE)低于 0.97 cm,Acc@5cm 超过 93.7%,浅层深度超过 96.8%。引入五阶段机制解释框架,识别 L23 层作为关键深度编码转换点,并实现选择性微调,训练参数减少 76-80%,同时保持准确率。Tier 3 配置在真实数据上实现 98.62% 准确率,表现出强大的在视觉遮挡下的鲁棒性。基于 TikTok 的数据管线经 Detroit 676 张标注洪水帧验证,证明了实时、众包式洪水感知的可行性。该框架提供了一个可扩展、无基础设施的解决方案,直接促进电动车安全、自动驾驶部署以及韧性交通管理。

关键词

引用

@article{arxiv.2603.17108,
  title  = {LLM-Powered Flood Depth Estimation from Social Media Imagery: A Vision-Language Model Framework with Mechanistic Interpretability for Transportation Resilience},
  author = {Nafis Fuad and Xiaodong Qian},
  journal= {arXiv preprint arXiv:2603.17108},
  year   = {2026}
}

备注

There is a update in result, which is needed to be addressed