中文

基于大规模视觉与语言模型的零样本建筑属性提取

计算机视觉与模式识别 2023-12-21 v1

摘要

现有的建筑识别方法(以 BRAILS 为代表)利用监督学习从卫星和街景图像中提取信息,以进行分类和分割。然而,每个任务模块都需要人工标注数据,这阻碍了其可扩展性以及对区域变化和标注不平衡的鲁棒性。作为回应,我们提出了一种用于建筑属性提取的新型零样本工作流,该工作流利用大规模视觉和语言模型来减轻对外部标注的依赖。所提出的工作流包含两个关键组件:基于与结构和土木工程相关词汇的建筑图像的图像级描述和片段级描述。这两个组件通过计算图像和词汇的特征表示,并促进视觉和文本表示之间的语义匹配,来生成描述性标题。因此,我们的框架为增强结构和土木工程领域中用于建筑属性提取的 AI 驱动描述提供了一条有前景的途径,最终在增强性能和适应性的同时减少了对人工标注的依赖。

关键词

引用

@article{arxiv.2312.12479,
  title  = {Zero-shot Building Attribute Extraction from Large-Scale Vision and Language Models},
  author = {Fei Pan and Sangryul Jeon and Brian Wang and Frank Mckenna and Stella X. Yu},
  journal= {arXiv preprint arXiv:2312.12479},
  year   = {2023}
}

备注

Accepted to WACV 2024, Project Page: https://sites.google.com/view/zobae/home