中文

COME:将场景中心预测控制加入占用世界模型

计算机视觉与模式识别 2025-06-17 v1

摘要

世界模型对于自动驾驶至关重要,用于模拟环境动态并生成合成数据。现有方法难以将自车运动(透视变化)与场景演化(智能体交互)解耦,导致预测效果不佳。相反,我们提出通过利用场景中心坐标系将环境变化与自车运动分离。本文提出COME:一个将场景中心预测控制集成到占用世界模型中的框架。具体而言,COME首先通过场景中心预测分支生成与自车无关、空间一致的未来特征,然后通过定制的ControlNet将其转换为场景条件。这些条件特征随后被注入占用世界模型,从而实现更准确和可控的未来占用预测。在nuScenes-Occ3D数据集上的实验结果表明,COME在不同配置下(包括不同输入源:真值、基于相机的、融合式占用,以及不同预测时间范围:3秒和8秒)均相较于最先进(SOTA)方法取得了一致且显著的改进。例如,在相同设置下,COME的mIoU指标比DOME高26.3%,比UniScene高23.7%。这些结果凸显了解耦表征学习在提升世界模型时空预测保真度方面的有效性。代码和视频将发布于 https://github.com/synsin0/COME。

关键词

引用

@article{arxiv.2506.13260,
  title  = {COME: Adding Scene-Centric Forecasting Control to Occupancy World Model},
  author = {Yining Shi and Kun Jiang and Qiang Meng and Ke Wang and Jiabao Wang and Wenchao Sun and Tuopu Wen and Mengmeng Yang and Diange Yang},
  journal= {arXiv preprint arXiv:2506.13260},
  year   = {2025}
}