中文

UniFuture:用于未来生成与感知的统一4D驾驶世界模型

计算机视觉与模式识别 2026-02-27 v2

摘要

我们提出 UniFuture,一个统一的4D驾驶世界模型,用于模拟3D物理世界的动态演化。与现有专注于2D像素级视频生成(缺乏几何信息)或静态感知(缺乏时间动态)的驾驶世界模型不同,我们的方法桥接了外观与几何信息,以构建完整的4D表示。具体而言,我们将未来RGB图像和深度图视为同一4D现实的耦合投影,并在单一框架内联合建模。为实现此目标,我们引入双潜在共享(DLS)方案,将视觉和几何模态映射到共享的时空潜在空间,从而在隐式方式中将纹理与结构编织在一起。此外,我们提出多尺度潜在交互(MLI)机制,强制实现双向一致性:几何约束视觉合成以防止结构幻觉,而视觉语义则细化几何估计。在推断期间,UniFuture可从当前单帧图像预测高保真、几何一致的4D场景序列(图像-深度对)。在nuScenes和Waymo数据集上的大量实验表明,我们的方法在未来生成和几何感知方面均优于专门模型,凸显了统一4D建模对于自动驾驶的有效性。代码已公开于https://github.com/dk-liang/UniFuture。

关键词

引用

@article{arxiv.2503.13587,
  title  = {UniFuture: A 4D Driving World Model for Future Generation and Perception},
  author = {Dingkang Liang and Dingyuan Zhang and Xin Zhou and Sifan Tu and Tianrui Feng and Xiaofan Li and Yumeng Zhang and Mingyang Du and Xiao Tan and Xiang Bai},
  journal= {arXiv preprint arXiv:2503.13587},
  year   = {2026}
}

备注

Accepted by ICRA 2026