中文

基于解耦动态流与图像辅助训练的高效占用世界模型

计算机视觉与模式识别 2024-12-19 v1

摘要

自动驾驶领域正经历对世界模型的浓厚兴趣,世界模型旨在基于历史观测预测潜在的未来场景。在本文中,我们介绍了DFIT-OccWorld,这是一个高效的3D占用世界模型,它利用解耦动态流和图像辅助训练策略,大幅提升了4D场景预测性能。为简化训练过程,我们舍弃了先前的两阶段训练策略,创新地将占用预测问题重新表述为解耦的体素变形过程。我们的模型通过使用体素流变形现有观测来预测未来的动态体素,而静态体素则可通过姿态变换轻松获得。此外,我们的方法结合了图像辅助训练范式以增强预测可靠性。具体而言,采用可微分体渲染通过预测的未来体素生成渲染深度图,并将其应用于基于渲染的光度一致性。实验证明了我们方法的有效性,展示了其在nuScenes和OpenScene基准上在4D占用预测、端到端运动规划和点云预测方面的最先进性能。具体而言,与现有的3D世界模型相比,它在实现最先进性能的同时产生了大幅降低的计算成本。

关键词

引用

@article{arxiv.2412.13772,
  title  = {An Efficient Occupancy World Model via Decoupled Dynamic Flow and Image-assisted Training},
  author = {Haiming Zhang and Ying Xue and Xu Yan and Jiacheng Zhang and Weichao Qiu and Dongfeng Bai and Bingbing Liu and Shuguang Cui and Zhen Li},
  journal= {arXiv preprint arXiv:2412.13772},
  year   = {2024}
}