利用潜在世界模型增强端到端自动驾驶
计算机视觉与模式识别
2025-03-03 v2
摘要
在自动驾驶中,端到端规划器直接利用原始传感器数据,与传统规划器相比,能够提取更丰富的场景特征并减少信息损失。这引发了一个关键的研究问题:我们如何开发更好的场景特征表示,以在端到端驾驶中充分利用传感器数据?自监督学习方法在NLP和计算机视觉中学习丰富特征表示方面取得了巨大成功。受此启发,我们提出了一种新颖的自监督学习方法,即用于端到端驾驶的潜在世界模型(LAW)。LAW基于当前特征和自车轨迹预测未来的场景特征。这个自监督任务可以无缝集成到无感知和基于感知的框架中,改进场景特征学习并优化轨迹预测。LAW在多个基准测试中取得了最先进的性能,包括真实世界开环基准测试nuScenes、NAVSIM和基于模拟器的闭环基准测试CARLA。代码发布在 https://github.com/BraveGroup/LAW。
引用
@article{arxiv.2406.08481,
title = {Enhancing End-to-End Autonomous Driving with Latent World Model},
author = {Yingyan Li and Lue Fan and Jiawei He and Yuqi Wang and Yuntao Chen and Zhaoxiang Zhang and Tieniu Tan},
journal= {arXiv preprint arXiv:2406.08481},
year = {2025}
}
备注
ICLR 2025