中文

DriveFuture:面向自动驾驶的未来感知潜在世界模型

计算机视觉与模式识别 2026-05-12 v1

摘要

现有的自动驾驶潜在世界模型为未来感知的驾驶智能开辟了一条充满希望的道路。然而,它们通常将未来潜在状态视为预测目标或辅助信号,而不是直接对轨迹规划进行条件化。这可能会在潜在空间中纠缠当前和未来的特征。在这项工作中,我们提出了 DriveFuture,一个面向自动驾驶的未来感知潜在世界建模框架,它通过将当前潜在状态建模过程以未来世界状态为条件,显式地学习面向规划的预见性。具体而言,在训练期间,模型首先根据当前潜在状态和自车动作预测未来潜在世界状态,然后通过交叉注意力机制利用真实的未来潜在状态来优化该预测。由此产生的未来感知潜在表示作为基于扩散的轨迹规划器的显式条件。在推理期间,DriveFuture 以预测的未来潜在状态而非真实的未来状态为条件。DriveFuture 在公开的 NAVSIM 基准测试上取得了 SOTA 性能,分别在 NAVSIM-v2 {\textcolor{blue}{\textit{navhard}}} 上达到 \textbf{55.5} EPDMS,在 NAVSIM-v2 {\textcolor{blue}{\textit{navtest}}} 上达到 \textbf{89.9} EPDMS,在 NAVSIM-v1 {\textcolor{blue}{\textit{navtest}}} 上达到 \textbf{90.7} PDMS。这些结果表明,潜在世界建模的关键不仅在于模拟未来状态,更重要的是将当前决策以未来状态为条件。值得注意的是,截至 2026 年 4 月,DriveFuture 在 \href{https://huggingface.co/spaces/AGC2025/e2e-driving-navhard}{NAVSIM-v2 {\textcolor{blue}{\textit{navhard}}}} 排行榜上排名第一,并在 \href{https://huggingface.co/spaces/AGC2024-P/e2e-driving-navtest}{NAVSIM-v1 {\textcolor{blue}{\textit{navtest}}}} 上取得了 SOTA 性能。

关键词

引用

@article{arxiv.2605.09701,
  title  = {DriveFuture: Future-Aware Latent World Models for Autonomous Driving},
  author = {Yufeng Hong and Xiaotian Zhou and Yingyan Li and Xiangpo Zhou and Lin Liu and Yadan Luo and Shaoqing Xu and Lei Yang and Ziying Song},
  journal= {arXiv preprint arXiv:2605.09701},
  year   = {2026}
}

备注

24pages, 7 figures