中文

CoReVLA:基于 Collect-and-Refine 的双阶段端到端自动驾驶框架应对长尾场景

机器人学 2025-09-22 v1 计算机视觉与模式识别

摘要

自动驾驶 (AD) 系统已取得显著进展,但其在长尾、安全关键场景中的性能仍然有限。这些罕见案例导致了不成比例的大量事故。视觉-语言-动作 (VLA) 模型具有强大的推理能力并提供了一种潜在的解决方案,但由于缺乏高质量数据以及在此类条件下学习效率低下,其有效性受到限制。为了应对这些挑战,我们提出了 CoReVLA,一个持续学习的端到端自动驾驶框架,通过数据收集和行为精炼的双阶段过程来提升长尾场景的性能。首先,在开源驾驶问答数据集的混合数据上联合微调模型,使其获得对驾驶场景的基础理解。接着,将 CoReVLA 部署于 Cave Automatic Virtual Environment (CAVE) 仿真平台中,通过实时交互收集驾驶员接管数据。每次接管都表明 CoReVLA 无法可靠处理的长尾场景。最后,通过直接偏好优化 (DPO) 精炼模型,使其直接从人类偏好中学习,从而避免由人工设计奖励导致的奖励作弊。大量开环和闭环实验表明,所提出的 CoReVLA 模型能够准确感知驾驶场景并做出适当决策。在 Bench2Drive 基准上,CoReVLA 取得了 72.18 的驾驶分数 (DS) 和 50% 的成功率 (SR),在长尾、安全关键场景下比 SOTA 方法高出 7.96 DS 和 15% SR。此外,案例研究表明,该模型能够利用过往的接管经验,在类似的易失败场景中持续提升其性能。所有代码和预处理数据集均位于:https://github.com/FanGShiYuu/CoReVLA

关键词

引用

@article{arxiv.2509.15968,
  title  = {CoReVLA: A Dual-Stage End-to-End Autonomous Driving Framework for Long-Tail Scenarios via Collect-and-Refine},
  author = {Shiyu Fang and Yiming Cui and Haoyang Liang and Chen Lv and Peng Hang and Jian Sun},
  journal= {arXiv preprint arXiv:2509.15968},
  year   = {2025}
}