中文

OpenREAD:面向端到端自主驾驶的强化开放式推理框架

计算机视觉与模式识别 2025-12-03 v2

摘要

最近,两种微调策略,如通过监督微调(SFT)获取基本驾驶知识,再通过强化微调(RFT)进一步提升决策与规划,已在推动知识驱动型自主驾驶(AD)范式方面显示出强大的潜力。然而,SFT 的学习本质仍限制了推理的泛化,从而约束了驾驶性能的全部潜力。同时,当前的 RFT 方法主要应用于下游任务,由于场景理解是开放性问题,难以量化相应的奖励。为此,我们提出了 OpenREAD,一种基于开放式推理强化的视觉语言模型(VLM)框架,用于自主驾驶(AD),使其能够在从高级推理到低级轨迹规划的完整层次上进行端到端 RFT。具体而言,我们在开源驾驶相关知识数据集上构建了大规模链式思维(CoT)标注,并运用强大的 Qwen3 大语言模型(LLM)作为 RFT 中的评论家,用于量化开放性问题中推理质量的奖励建模。广泛的实验表明,联合端到端 RFT 在上游和下游任务上均取得显著提升,使 OpenREAD 能够在推理与规划基准测试中实现最先进的性能。

关键词

引用

@article{arxiv.2512.01830,
  title  = {OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic},
  author = {Songyan Zhang and Wenhui Huang and Zhan Chen and Chua Jiahao Collister and Qihang Huang and Chen Lv},
  journal= {arXiv preprint arXiv:2512.01830},
  year   = {2025}
}