中文

Distill to Think, Foresee to Act: 面向自动驾驶的认知-物理强化学习

计算机视觉与模式识别 2026-05-25 v2 机器学习

摘要

当前的端到端自动驾驶模型在仿射学习的行为模仿上限方面受到根本性限制。尽管强化学习为更智能的自主性提供了路径,但它需要两块缺失的基础设施:(1)理解交通语义和驾驶意图的认知基础,(2)能够预测候选动作后果的前瞻性物理环境。为此,我们提出了 CoPhy,即用于自动驾驶的 CognitivePhysical 强化学习框架。通过 Distill to Think,我们将 VLM 知识蒸馏到 BEV 编码器中,然后完全丢弃 VLM,保留零推理成本下的认知能力,同时将认知通道作为可插拔的接口,用于可选的人类语言命令。通过 Foresee to Act,我们构建一个自回归 BEV 世界模型,显式地在候选动作条件下预测未来语义地图,作为可解释的物理沙箱,从中直接派生安全指标。基于这两个基础设施,我们通过 GRPO 优化驾驶策略,采用一种新颖的双奖励机制:来自 BEV 滚动的物理奖励强制执行硬性安全约束,而来自语言对齐评分器的认知奖励确保意图合规。广泛的实验表明,CoPhy 不仅在 NAVSIM v1 和 v2 基准测试中实现了最先进的成绩,还通过认知感知的场景合规性和通过用户定义的语言指令实现灵活的意图控制,实现了更安全的驾驶。

关键词

引用

@article{arxiv.2605.21139,
  title  = {Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving},
  author = {Yang Wu and Qiang Meng and Zhaojiang Liu and Youquan Liu and Jian Yang and Jin Xie},
  journal= {arXiv preprint arXiv:2605.21139},
  year   = {2026}
}