Latent-WAM:基于潜在世界动作建模的端到端自动驾驶
计算机视觉与模式识别
2026-03-26 v1 机器人学
摘要
我们提出 Latent-WAM,一种高效的端到端自动驾驶框架,通过空间感知和动力学信息化的潜在世界表示实现强大的轨迹规划。现有的基于世界模型的规划器 suffer from 表示压缩不足、空间理解有限以及历史动力学被低估使用,导致在受限数据和计算预算下进行次优规划。Latent-WAM 通过两个核心模块解决了这些限制:一个空间感知压缩世界编码器(SCWE),从基础模型中提取几何知识,并通过可学习查询将多视角图像压缩为紧凑的场景标记;以及动态潜在世界模型(DLWM),采用因果 Transformer 自回归预测未来世界状态,条件化于历史视觉和动作表示。在 NAVSIM v2 和 HUGSIM 上的大规模实验表明,我们实现了新的最佳结果:NAVSIM v2 上达到 89.3 EPDMS,HUGSIM 上达到 28.9 HD-Score,超越了最佳的无感知方法提升了 3.2 EPDMS,同时使用更少的训练数据和一个紧凑的 1.04 亿参数模型。
引用
@article{arxiv.2603.24581,
title = {Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving},
author = {Linbo Wang and Yupeng Zheng and Qiang Chen and Shiwei Li and Yichen Zhang and Zebin Xing and Qichao Zhang and Xiang Li and Deheng Qian and Pengxuan Yang and Yihang Dong and Ce Hao and Xiaoqing Ye and Junyu han and Yifeng Pan and Dongbin Zhao},
journal= {arXiv preprint arXiv:2603.24581},
year = {2026}
}