OmniNWM:全知全景驾驶导航世界模型
计算机视觉与模式识别
2025-11-18 v4
摘要
自动驾驶世界模型预期在三个核心维度上有效工作:状态、动作和奖励。然而,现有模型通常局限于有限的状态模态、短视频序列、不精确的动作控制以及缺乏奖励感知。在本文中,我们介绍了OmniNWM,一个全知全景导航世界模型,它在统一框架内处理所有三个维度。对于状态,OmniNWM联合生成RGB、语义、度量深度和3D占用的全景视频。一种灵活的强制策略实现了高质量的长时程自回归生成。对于动作,我们引入了一种归一化的全景Plücker射线图表示,它将输入轨迹编码为像素级信号,从而实现对全景视频生成的高度精确和可泛化的控制。关于奖励,我们超越了使用外部基于图像的模型学习奖励函数:相反,我们利用生成的3D占用直接定义基于规则的密集奖励,用于驾驶合规性和安全性。大量实验表明,OmniNWM在视频生成、控制精度和长时程稳定性方面达到了最先进的性能,并通过基于占用的奖励提供了一个可靠的闭环评估框架。项目页面可在 https://arlo0o.github.io/OmniNWM/ 获取。
引用
@article{arxiv.2510.18313,
title = {OmniNWM: Omniscient Driving Navigation World Models},
author = {Bohan Li and Zhuang Ma and Dalong Du and Baorui Peng and Zhujin Liang and Zhenqiang Liu and Chao Ma and Yueming Jin and Hao Zhao and Wenjun Zeng and Xin Jin},
journal= {arXiv preprint arXiv:2510.18313},
year = {2025}
}
备注
https://arlo0o.github.io/OmniNWM/