Mapillary Vistas交通标志验证:揭示视觉语言模型局限的基准
计算机视觉与模式识别
2025-08-05 v1
摘要
获取高质量的交通标志细粒度标注对于实现准确安全的决策至关重要。广泛使用的地图数据集(如Mapillary)通常仅提供粗粒度标签——缺乏对如停止标志或速度限制标志等语义关键类型的区分。为此,我们提出一种新的交通标志验证集,源自Mapillary数据集,称为Mapillary Vistas Validation for Traffic Signs(MVV),将复合交通标志分解为细粒度、语义上有意义的类别。该数据集包括像素级实例掩码,由专家标注员手动标注以确保标签忠实。进一步,我们对几类SOTA视觉语言模型(VLM)进行基准测试,结果显示DINOv2在交通标志识别以及如此被广泛代表的类别(如车辆和人物)上均优于所有VLM基线。我们的分析揭示了当前视觉语言模型在细粒度视觉理解方面的显著局限,确立DINOv2作为自动驾驶场景下稠密语义匹配的强基线。该数据集和评估框架为可靠、可解释且可扩展的感知系统铺平了道路。代码与数据可获取于:https://github.com/nec-labs-ma/relabeling
引用
@article{arxiv.2508.02047,
title = {Mapillary Vistas Validation for Fine-Grained Traffic Signs: A Benchmark Revealing Vision-Language Model Limitations},
author = {Sparsh Garg and Abhishek Aich},
journal= {arXiv preprint arXiv:2508.02047},
year = {2025}
}
备注
Accepted to ICCV 2025 Workshop (4th DataCV Workshop and Challenge)