探究多模态基础模型在街景图像中的承诺与困难
计算机视觉与模式识别
2024-08-26 v1 人工智能
摘要
大型语言模型( LLM)和多模态基础模型( FM)的出现引发了对其集成视觉与语言应用的浓厚兴趣。本文评估了 ChatGPT-4V 和 Gemini Pro 在街景图像、建筑环境和室内中的能力。评估包括街景图像中的街道设施识别、行人和汽车计数、道路宽度测量;建筑环境中的建筑功能分类、建筑年龄分析、建筑高度分析、建筑结构分类;以及室内中的房间分类、室内设计风格分析、室内家具计数、室内长度测量。结果显示在长度测量、风格分析、问答和基础图像理解方面表现良好,但在详细识别和计数任务中存在局限。零样本学习显示出潜力,但性能取决于问题域和图像复杂度。本研究为多模态基础模型在街景图像、建筑环境和室内实际挑战中之力与弱提供了新见解。总体而言,本文展示了基础的多模态智能,强调了 FM 在计算机视觉与语言交叉领域推动 interdisciplinary 应用的潜力。
引用
@article{arxiv.2408.12821,
title = {Examining the Commitments and Difficulties Inherent in Multimodal Foundation Models for Street View Imagery},
author = {Zhenyuan Yang and Xuhui Lin and Qinyi He and Ziye Huang and Zhengliang Liu and Hanqi Jiang and Peng Shu and Zihao Wu and Yiwei Li and Stephen Law and Gengchen Mai and Tianming Liu and Tao Yang},
journal= {arXiv preprint arXiv:2408.12821},
year = {2024}
}