中文

DriveAction:面向VLA模型的人类化驾驶决策基准

计算机视觉与模式识别 2025-09-29 v2 人工智能

摘要

Vision-Language-Action(VLA)模型已推动自动驾驶领域的进步,但现有基准测试仍缺乏情景多样性、可靠的行动级标注以及与人类偏好相吻合的评估协议。为此,我们引入DriveAction——第一个专为VLA模型设计的行动驱动基准,包含16,185个由2,610个驾驶情景生成的QA对。DriveAction利用来自自动驾驶车辆驾驶员的真实世界驾驶数据,确保覆盖广泛且具代表性的情景;提供来自驾驶员实际驾驶操作的高层次离散行动标签;并实施以行动为核心的树状评估框架,显式关联视觉、语言与行动任务,支持全面和任务特定的评估。我们的实验表明,最新的视觉语言模型(VLM)在准确预测行动时需要视觉与语言指导:平均而言,缺少视觉输入时准确率下降3.3%,缺少语言输入时下降4.1%,两者缺失时下降8.0%。我们的评估支持精确识别模型瓶颈,结果稳健且一致,从而为推动自动驾驶中的人类化决策提供新见解和严谨基础。

关键词

引用

@article{arxiv.2506.05667,
  title  = {DriveAction: A Benchmark for Exploring Human-like Driving Decisions in VLA Models},
  author = {Yuhan Hao and Zhengning Li and Lei Sun and Weilong Wang and Naixin Yi and Sheng Song and Caihong Qin and Mofan Zhou and Yifei Zhan and Xianpeng Lang},
  journal= {arXiv preprint arXiv:2506.05667},
  year   = {2025}
}

备注

Benchmark: https://huggingface.co/datasets/LiAuto-DriveAction/drive-action