ELEV-VISION-SAM:用于自动估计建筑最低楼层标高的视觉语言与基础模型集成
计算机视觉与模式识别
2025-06-10 v1
摘要
得益于图像质量和可及性的进步,街景图像已成为城市分析研究的宝贵资源。近期研究探索了其在估计最低楼层标高(LFE)方面的潜力,为传统现场测量提供了可扩展的替代方案,这对于评估房产的洪水风险和损害程度至关重要。虽然现有方法依赖目标检测,但图像分割的引入拓宽了街景图像在 LFE 估计中的用途,尽管在分割质量和区分前门与其他门的能力方面仍存在挑战。为了解决 LFE 估计中的这些挑战,本研究将 Segment Anything 模型(一种分割基础模型)与视觉语言模型相结合,对街景图像进行文本提示的图像分割以进行 LFE 估计。通过评估各种视觉语言模型、集成方法和文本提示,我们确定了最适合街景图像分析和 LFE 估计任务的模型,从而将基于图像分割的当前 LFE 估计模型的可用性从 33% 的房产提高到 56%。值得注意的是,我们提出的方法显著增强了 LFE 估计的可用性,使其几乎适用于所有在街景图像中可见前门的房产。此外,研究结果提供了基于街景图像的 LFE 估计中各种视觉模型的第一个基线和比较。该模型和研究结果不仅有助于推进用于城市分析的街景图像分割,还为其他土木工程和基础设施分析任务的图像分割任务提供了一种新方法。
引用
@article{arxiv.2404.12606,
title = {ELEV-VISION-SAM: Integrated Vision Language and Foundation Model for Automated Estimation of Building Lowest Floor Elevation},
author = {Yu-Hsuan Ho and Longxiang Li and Ali Mostafavi},
journal= {arXiv preprint arXiv:2404.12606},
year = {2025}
}