中文

评估后驱动:基于批评家中心的视觉语言动作框架用于自动驾驶

计算机视觉与模式识别 2026-05-01 v1

摘要

近期视觉语言动作 (VLA) 模型的进展显示出巨大的潜力,可直接将多模态输入映射到控制信号,用于自动驾驶。然而,之前的 VLA 方法未显式地利用 VLA 的批评能力来细化驾驶决策,尽管该能力在其他 LLM 领域已被充分证明,这限制了其在复杂封闭环场景中的性能。本文提出了一种理论驱动的两阶段框架,CriticVLA 将 VLA 的角色从执行扩展到评估。CriticVLA 首先生成粗略轨迹,然后通过基于 VLA 的批评家指导的多模态评估和单步优化来细化,从而产生更高质量的驾驶行为。为支持此过程,我们构建了一个规模为 1290 万条标注轨迹的大型合成数据集,涵盖多样化的驾驶场景,增强了批评家的推理和细化能力。在 Bench2Drive 数据集上的大规模封闭环实验表明,CriticVLA 显著优于最先进的基线,总体成功率达 73.33%,在具有挑战性的场景中实现约 30% 的提升。

关键词

引用

@article{arxiv.2604.27366,
  title  = {Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving},
  author = {Lijin Yang and Jianing Huang and Zhongzhan Huang and Shu Liu and Hao Yang},
  journal= {arXiv preprint arXiv:2604.27366},
  year   = {2026}
}

备注

preprint