中文

城市视觉数据集竞赛与模型:面向印度交通的图像标注与精准视觉模型

计算机视觉与模式识别 2025-11-05 v1

摘要

本报告描述了 UVH-26 数据集,这是 AIM@IISc 首次公开的大型印度交通摄像头图像标注数据集。数据集包含 26,646 张高分辨率(1080p)图像,采样自 2800 台班加罗尔的 Safe-City CCTV 摄像头,覆盖 4 周期间,随后通过 565 名来自全印度的大学生参与的众包竞赛进行标注。总共标注了 180 万个边界框,覆盖 14 类印度特有的车辆类别:自行车、2 轮(摩托车)、3 轮(自动三轮车)、轻型商业车辆(LCV)、货车、客运小巴、轿车、轿车、SUV、MUV、迷你巴士、巴士、卡车和其他。其中,28.3k-31.6k 个共识标注边界框和标签用于 26k 张图像,使用多数投票和 STAPLE 算法。进一步,我们训练了多种当代检测器,包括 YOLO11-S/X、RT-DETR-S/X 和 DAMO-YOLO-T/L,使用这些数据集,并报告基于 mAP50、mAP75 和 mAP50:95 的准确率。在 UVH-26 上训练的模型在 COCO 数据集上训练的等效基线模型的 mAP50:95 上实现了 8.4-31.5% 的提升,其中 RT-DETR-X 在共用类别(Car、Bus 和 Truck)上的表现最佳,mAP50:95 为 0.67,而 COCO 训练权重为 0.40。这表明了针对印度交通情景的领域特定训练数据所带来的好处。该发布包提供 26k 张图像及其基于多数投票(UVH-26-MV)和 STAPLE(UVH-26-ST)的共识标注,以及在每个数据集上训练的 6 个 YOLO 和 DETR 模型。通过直接从印度城市交通摄像头流中捕获印度城市交通的异质性,UVH-26 解决了现有全局基准中的关键差距,为在新兴国家复杂交通条件下检测、分类和部署智能交通系统提供了基础。

关键词

引用

@article{arxiv.2511.02563,
  title  = {The Urban Vision Hackathon Dataset and Models: Towards Image Annotations and Accurate Vision Models for Indian Traffic},
  author = {Akash Sharma and Chinmay Mhatre and Sankalp Gawali and Ruthvik Bokkasam and Brij Kishore and Vishwajeet Pattanaik and Tarun Rambha and Abdul R. Pinjari and Vijay Kovvali and Anirban Chakraborty and Punit Rathore and Raghu Krishnapuram and Yogesh Simmhan},
  journal= {arXiv preprint arXiv:2511.02563},
  year   = {2025}
}