中文

见今日行今日:面向自主驾驶的前瞻驱动方法

计算机视觉与模式识别 2026-05-11 v1

摘要

当前端到端自主驾驶规划器本质上是反应性的:基于历史和当前观察预测未来动作。我们认为,自主代理应先于决定动作,想象未来场景,如同人类驾驶员在行动前进行"下一步会发生什么"的心理模拟。我们引入ForeSight,一种以世界模型为核心的前瞻规划框架,将自主驾驶重新定义为anticipatory decision-making。我们的做法不将世界模型视为辅助组件,而是将未来场景想象置于动作预测的首要位置。该方法包含两个阶段:(1)通过预训练世界模型生成合理的未来视觉场景,(2)基于这些想象的未来进行动作规划。这种从"现在应该做什么"到"下一步会发生,如何回应"的范式转变,实现了真正的anticipatory而非reactive规划。通过以预期情境而非仅当前观察为决策依据,ForeSight在动态交互场景中表现更佳。在NAVSIM和nuScenes上的大规模实验表明,显式的前瞻想象显著优于先前的state-of-the-art替代方案,验证了我们的前瞻驱动方法。

关键词

引用

@article{arxiv.2605.07195,
  title  = {See Tomorrow, Act Today: Foresight-Driven Autonomous Driving},
  author = {Bozhou Zhang and Nan Song and Yuang Wang and Jiankang Deng and Xiatian Zhu and Li Zhang},
  journal= {arXiv preprint arXiv:2605.07195},
  year   = {2026}
}

备注

CVPR Findings 2026