面向建成环境零标注:基于视觉语言模型的路径
计算机视觉与模式识别
2024-08-05 v1 计算与语言
摘要
公平的城市交通应用需要高保真的数字建成环境表示:不仅仅是街道和人行道,还包括自行车车道、标示和未标示的横断面、坡道和凹槽、障碍物、交通信号灯、标志牌、街道标线、坑洼等。直接检查和手动标注在规模上是高昂的。常规机器学习方法需要大量的标注训练数据才能实现 adequate performance。本文我们考虑视觉语言模型作为从卫星图像中标注多样化城市特征的机制,减少对人类标注以产生大型训练集的依赖。虽然这些模型在描述来自人类视角捕获的图像中常见对象的方面已取得令人瞩目的成果,但它们的训练集较不可能包含建成环境中特殊特征的强信号,其在这些情形下的性能因此是不清楚的。我们演示了将一种最先进的视觉语言模型与若干提示策略结合的概念验证,其中提示策略要求模型独立于原始图像来考虑分段元素。针对两种城市特征——停车线和抬台——的实验表明,尽管直接的零shot提示几乎不正确地标注任何图像,但预分段策略可实现近40%的交并比准确率。我们描述了这些结果如何影响面向改善建成环境自动标注的新研究议程,这有助于在广泛且多样的环境中提高平等性、可达性和安全性。
引用
@article{arxiv.2408.00932,
title = {Towards Zero-Shot Annotation of the Built Environment with Vision-Language Models (Vision Paper)},
author = {Bin Han and Yiwei Yang and Anat Caspi and Bill Howe},
journal= {arXiv preprint arXiv:2408.00932},
year = {2024}
}