ScenePilot-4K:面向自动驾驶中视觉语言模型的大规模第一人称数据集与基准
计算机视觉与模式识别
2026-03-31 v3
摘要
在本文中,我们介绍了 ScenePilot-4K,一个用于自动驾驶中安全感知视觉语言学习与评估的大规模第一人称数据集。ScenePilot-4K 基于公开的在线驾驶视频构建,包含 3,847 小时的视频和 27.7M 前视帧,涵盖 63 个国家/地区和 1,210 个城市。它通过统一的流水线多阶段标注,共同提供了场景级自然语言描述、风险评估标签、关键参与者标注、ego 轨迹和相机参数。在此数据集的基础上,我们建立了 ScenePilot-Bench,这是一个标准化基准,沿四个互补的维度评估视觉语言模型:场景理解、空间感知、运动规划和基于 GPT 的语义对齐。该基准包含细粒度指标和地理泛化设置,以揭示模型在跨区域和跨交通领域偏移下的鲁棒性。在代表性开源和专有视觉语言模型上的基线结果表明,当前模型在高级场景语义方面仍具竞争力,但在几何感知和面向规划的推理方面仍存在实质性局限。除了发布的数据集本身,所提出的标注流水线还可作为从公共互联网驾驶视频中构建可扩展数据集的可重用且可扩展的方案。代码和补充材料可在以下地址获取:https://github.com/yjwangtj/ScenePilot-4K,数据集可在 https://huggingface.co/datasets/larswangtj/ScenePilot-4K 获取。
引用
@article{arxiv.2601.19582,
title = {ScenePilot-4K: A Large-Scale First-Person Dataset and Benchmark for Vision-Language Models in Autonomous Driving},
author = {Yujin Wang and Yutong Zheng and Wenxian Fan and Tianyi Wang and Hongqing Chu and Li Zhang and Bingzhao Gao and Daxin Tian and Jianqiang Wang and Hong Chen},
journal= {arXiv preprint arXiv:2601.19582},
year = {2026}
}