EponaV2:具备全面未来推理的驾驶世界模型
计算机视觉与模式识别
2026-05-15 v1
摘要
数据缩放在追求通用智能的过程中发挥着关键作用。然而,当前自动驾驶中的感知-规划范式严重依赖昂贵的人工标注来监督轨迹规划,这极大限制了其可扩展性。相反,尽管现有的无感知驾驶世界模型取得了令人印象深刻的驾驶性能,但其用于规划的真实世界推理能力仅建立在下一帧图像预测之上。由于缺乏足够的监督,这些模型往往难以全面理解场景,导致轨迹规划不尽如人意。在本文中,我们提出了 EponaV2,一种新的驾驶世界模型范式,它通过全面的未来推理实现了高质量规划。受人类驾驶员预期 3D 几何与语义方式的启发,我们训练模型预测更全面的未来表示,这些表示可额外解码为未来几何与语义地图。提取 3D 和语义模态使我们的模型能够深入理解周围环境,且未来预测任务显著增强了 EponaV2 的真实世界推理能力,最终带来改进的轨迹规划。此外,受大语言模型(LLMs)训练配方的启发,我们引入了流匹配群体相对策略优化机制以进一步提高规划精度。EponaV2 在三个 NAVSIM 基准上的无感知模型中取得了最先进(SOTA)的性能(+1.3 PDMS,+5.5 EPDMS),证明了我们方法的有效性。
引用
@article{arxiv.2605.14696,
title = {EponaV2: Driving World Model with Comprehensive Future Reasoning},
author = {Jiawei Xu and Zhizhou Zhong and Zhijian Shu and Mingkai Jia and Mingxiao Li and Jia-Wang Bian and Qian Zhang and Kaicheng Zhang and Jin Xie and Jian Yang and Wei Yin},
journal= {arXiv preprint arXiv:2605.14696},
year = {2026}
}