CARScenes:用于安全自动驾驶的语义视觉语言模型数据集
计算机视觉与模式识别
2025-11-19 v2 机器人学
摘要
CAR-Scenes 是一个面向自动驾驶的数据集,旨在支持视觉语言模型 (VLM) 的训练与评估,以实现可解释的场景级理解。我们对来自Argoverse 1、Cityscapes、KITTI和nuScenes的5,192张图像进行了帧级标注,构建覆盖环境、道路几何、背景车辆行为、自车行为、易受人群用户、传感器状态以及离散严重程度等级(1-10)的28类子类知识库,总计350多个叶子节点属性。标签由GPT-4o辅助的视觉语言管道生成,包含人类在环验证;我们公开确切的提示词、后处理规则以及每个字段的基线模型性能。CAR-Scenes 还提供属性共现图和JSONL记录,支持语义检索、数据分层和跨源的风险感知场景挖掘。为校准任务难度,我们包括可复现的非基准方法,尤其是经过LoRA微调的Qwen2-VL-2B模型,采用确定性解码进行评估,评估指标包括标量准确率、列表属性的微平均F1分数以及严重程度的MAE/RMSE,并在固定的验证分割上进行测试。我们公开标注和分析脚本,包括图构建和评估脚本,以支持面向未来智能车的可解释、数据中心化工作流程。数据集:https://github.com/Croquembouche/CAR-Scenes
引用
@article{arxiv.2511.10701,
title = {CARScenes: Semantic VLM Dataset for Safe Autonomous Driving},
author = {Yuankai He and Weisong Shi},
journal= {arXiv preprint arXiv:2511.10701},
year = {2025}
}
备注
8 pages, 6 figures, 7 tables