利用多模态 LLM 对街景图像中的建筑环境与住宅属性进行评估
计算机视觉与模式识别
2026-04-24 v1 人工智能
摘要
我们提出了一种新框架,利用大语言模型 (LLM) 和 Google Street View (GSV) 图像自动化评估美国全国范围内的建筑状况。通过对 Gemma 3 27B 进行微调,我们的方法在与人类平均意见得分 (MOS) 强对齐的同时,在 SRCC 和 PLCC 方面甚至超越了单个评分者。为提升效率,我们应用知识蒸馏,将 Gemma 3 27B 的能力迁移到更小的 Gemma 3 4B 模型,该模型实现了接近的性能,同时实现了 3 倍的加速。进一步地,我们将知识蒸馈到基于 CNN 的模型 (EfficientNetV2-M) 和基于 transformer 的模型 (SwinV2-B),在保持接近性能的同时实现了 30 倍的性能提升。此外,我们通过人类-AI 对齐研究探讨了 LLM 评估广泛建筑环境和住宅属性的能力,并开发了一个集成 LLM 评估结果的数据可视化仪表盘,以支持房主后续分析。我们的框架提供了一个灵活且高效的大规模建筑状况评估解决方案,实现高准确率且人工标注工作量最小。
引用
@article{arxiv.2604.21102,
title = {Leveraging Multimodal LLMs for Built Environment and Housing Attribute Assessment from Street-View Imagery},
author = {Siyuan Yao and Siavash Ghorbany and Kuangshi Ai and Arnav Cherukuthota and Meghan Forstchen and Alexis Korotasz and Matthew Sisk and Ming Hu and Chaoli Wang},
journal= {arXiv preprint arXiv:2604.21102},
year = {2026}
}