DeepSight:基于潜在状态预测的端到端自动驾驶长时程世界建模
计算机视觉与模式识别
2026-05-12 v1 机器人学
摘要
端到端自动驾驶系统正逐渐整合视觉语言模型(VLM)架构,融合文本推理或视觉推理,以提升驾驶决策的鲁棒性和准确性。然而,大多数方法所采用的推理机制是从通用领域直接移植的,缺乏针对自动驾驶场景的深入探索,尤其是在视觉推理模块方面。本文提出一种驾驶世界模型,执行对连续未来帧在鸟瞰视角(BEV)空间中潜在语义特征的平行预测,从而实现对未来世界状态的长时程建模。我们还引入一种高效且自适应的文本推理机制,利用额外的社交知识和推理能力进一步提升在挑战性长尾场景中的驾驶性能。我们提出了一种新颖、高效且有效的方法,在封闭环Bench2drive基准测试上实现了最先进(SOTA)结果。代码已公开:https://github.com/hotdogcheesewhite/DeepSight。
引用
@article{arxiv.2605.10564,
title = {DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving},
author = {Lingjun Zhang and Changjie Wu and Linzhe Shi and Jiangyang Li and Jiaxin Liu and Lei Yang and Hang Zhang and Mu Xu and Hong Wang},
journal= {arXiv preprint arXiv:2605.10564},
year = {2026}
}
备注
ICML 2026