V-RoAst:视觉道路评估。视觉语言模型能否作为道路安全评估师使用 iRAP 标准?
计算机视觉与模式识别
2026-05-07 v5 人工智能
新兴技术
摘要
道路安全评估是关键且昂贵的任务,尤其是在低中等收入国家 (LMICs),其中大多数道路尚未评估。传统方法需要专家标注和训练数据,而基于监督学习的方法在不同地区难以泛化。在本文中,我们提出了 \textit{V-RoAst},一个基于视觉语言模型 (VLM) 的零样态视觉问答 (VQA) 框架,用于按 iRAP 标准对道路安全属性进行分类。我们引入了来自 ThaiRAP 的第一个开源数据集,包含超过 2000 张为此任务标注的精选街景图像。我们对 Gemini-1.5-flash 和 GPT-4o-mini 在该数据集上的表现进行评估,并将其性能与 VGGNet 和 ResNet 的基线进行基准测试。尽管 VLM 在空间感知方面表现不足,但它们对未见类别具有良好泛化性,并能在无需重新训练的情况下提供灵活的基于提示的推理。我们的结果表明,VLM 可作为集成补充数据后的自动道路评估工具。本工作首次探索 VLM 用于零样态基础设施风险评估,为自动化、低成本道路安全制图开辟了新方向。代码和数据集:https://github.com/PongNJ/V-RoAst。
引用
@article{arxiv.2408.10872,
title = {V-RoAst: Visual Road Assessment. Can VLM be a Road Safety Assessor Using the iRAP Standard?},
author = {Natchapon Jongwiriyanurak and Zichao Zeng and June Moh Goo and Xinglei Wang and Ilya Ilyankou and Kerkritt Sriroongvikrai and Nicola Christie and Meihui Wang and Huanfa Chen and James Haworth},
journal= {arXiv preprint arXiv:2408.10872},
year = {2026}
}