ResWorld:面向端到端自动驾驶的时序残差世界模型
计算机视觉与模式识别
2026-02-12 v1
摘要
世界模型对驾驶情境的综合理解能力显著提高了端到端自动驾驶框架的规划精度。然而,静态区域的冗余建模以及缺乏与轨迹的深度交互阻碍了世界模型发挥最大效能。本文提出时序残差世界模型 (TR-World),其聚焦于动态物体建模。通过计算场景表示的时序残差,可提取动态物体信息,而无需依赖检测和跟踪。TR-World 仅以时序残差为输入,从而更准确地预测动态物体的未来空间分布。通过将预测结果与当前 BEV 特征中包含的静态物体信息结合,可获得准确的未来 BEV 特征。此外,我们提出了未来引导轨迹细化 (FGTR) 模块,该模块在先前轨迹(由当前场景表示预测得出)和未来 BEV 特征之间进行交互。该模块不仅可利用未来道路条件细化轨迹,还能为未来 BEV 特征提供稀疏时空监督,以防止世界模型崩溃。在 nuScenes 和 NAVSIM 数据集上进行的全面实验表明,我们的方法即 ResWorld 达到了最先进的规划性能。代码地址为 https://github.com/mengtan00/ResWorld.git。
引用
@article{arxiv.2602.10884,
title = {ResWorld: Temporal Residual World Model for End-to-End Autonomous Driving},
author = {Jinqing Zhang and Zehua Fu and Zelin Xu and Wenying Dai and Qingjie Liu and Yunhong Wang},
journal= {arXiv preprint arXiv:2602.10884},
year = {2026}
}
备注
ICLR 2026