CoVLA:面向自动驾驶的综合视觉-语言-动作数据集
计算机视觉与模式识别
2025-10-15 v3
摘要
自动驾驶,特别是应对复杂和未预见场景的导航,需要精密的推理与规划能力。虽然多模态大语言模型(MLLM)为此提供了有前景的途径,但其应用大多局限于理解复杂环境上下文或生成高层驾驶指令,很少有研究将其应用扩展到端到端路径规划。一个主要的研究瓶颈是缺乏涵盖视觉、语言和动作的大规模标注数据集。为解决这一问题,我们提出了CoVLA(Comprehensive Vision-Language-Action)数据集,一个包含超过80小时真实驾驶视频的大规模数据集。该数据集利用一种基于自动化数据处理和描述生成流水线的新型可扩展方法,生成精确的驾驶轨迹,并配以驾驶环境和操作的详细自然语言描述。该方法利用原始车载传感器数据,使其在规模和标注丰富度上超越现有数据集。利用CoVLA,我们研究了能够处理多种驾驶场景中视觉、语言和动作的MLLM的驾驶能力。我们的结果展示了模型在生成连贯语言和动作输出方面的强大能力,强调了视觉-语言-动作(VLA)模型在自动驾驶领域的潜力。该数据集通过为训练和评估VLA模型提供全面平台,为构建鲁棒、可解释和数据驱动的自动驾驶系统奠定了框架,有助于实现更安全、更可靠的自动驾驶车辆。该数据集面向学术目的发布。
引用
@article{arxiv.2408.10845,
title = {CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving},
author = {Hidehisa Arai and Keita Miwa and Kento Sasaki and Yu Yamaguchi and Kohei Watanabe and Shunsuke Aoki and Issei Yamamoto},
journal= {arXiv preprint arXiv:2408.10845},
year = {2025}
}
备注
WACV 2025, Project Page: https://turingmotors.github.io/covla-ad/