中文

DLWM:基于双潜在世界模型的高斯中心化自治驾驶整体预训练方法

计算机视觉与模式识别 2026-04-02 v1

摘要

视觉无人驾驶因其低成本和优异性能而受到广泛关注。与稠密鸟瞰图(BEV)或稀疏查询模型相比,基于高斯的 method 作为一种综合且稀疏的表示,通过描述由 3D 语义高斯构成的场景。本文介绍 DLWM,一种新颖的范式,采用 Dual Latent World Models 专为在自动驾驶中实现基于高斯的整体预训练而设计,包含两个阶段。在第一个阶段,DLWM 通过自监督方式从查询预测 3D 高斯,以重建多视图语义和深度图像。配备细粒度上下文特征后,在第二个阶段,两个潜在世界模型分别进行时序特征学习,包括基于高斯流引导的时空特征预测,用于下游占有感知和预测任务,以及基于 ego-planning 引导的时空特征预测,用于运动规划。在 SurroundOcc 和 nuScenes 基准测试中进行的大量实验表明,DLWM 在基于高斯的 3D 占有感知、4D 占有预测和运动规划任务方面显示出显著的性能提升。

关键词

引用

@article{arxiv.2604.00969,
  title  = {DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving},
  author = {Yiyao Zhu and Ying Xue and Haiming Zhang and Guangfeng Jiang and Wending Zhou and Xu Yan and Jiantao Gao and Yingjie Cai and Bingbing Liu and Zhen Li and Shaojie Shen},
  journal= {arXiv preprint arXiv:2604.00969},
  year   = {2026}
}

备注

Accepted by CVPR 2026