中文

小米汽车世界模型:融合重建与生成的联合世界模型用于自动驾驶

计算机视觉与模式识别 2026-05-28 v5

摘要

本报告提出了一个统一的技术系统,旨在解决自动驾驶世界模型的两个核心能力:世界表示与世界生成。在世界表示方面,我们提出了 WorldRec,一种由稀疏场景查询驱动的前馈重建架构。WorldRec 在 3D 空间中初始化结构化查询,利用其聚合跨视图、跨时间特征,从而自然地强制执行跨帧的空间一致性,并生成紧凑且高保真的 3D 高斯场景表示。在世界生成方面,我们提出了 WorldGen,这是一个两阶段训练框架,包含双向预训练以及通过三个渐进阶段(Teacher Forcing、ODE 蒸馏和 DMD)进行的因果微调,实现了仅需 4 个去噪步骤的高质量在线因果视频生成。基于这两个模块,我们进一步引入了 JWM,深度融合 WorldRec 和 WorldGen,在生成稳定性、跨帧一致性和视觉保真度上实现协同增益,为自动驾驶中的闭环仿真、数据合成和端到端训练提供了坚实基础。

关键词

引用

@article{arxiv.2605.18137,
  title  = {Xiaomi Auto World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving},
  author = {Lijun Zhou and Hongcheng Luo and Zhenxin Zhu and Cheng Chi and Mingfei Tu and Kaixin Xiong and Lei Gong and Zhanqian Wu and Zehan Zhang and Fangzhen Li and Hao Li and Yingying Shen and Jiale He and Haohui Zhu and Shan Zhao and Kai Wang and Zhiwei Zhan and Yuechuan Pu and Kaiyuan Tan and Ruiling Yang and Xianqi Wang and Tianyi Yan and Jiawei Zhou and Lei Zhang and Jingyang Zhao and Xi Zhou and Chitian Sun and Chenming Wu and Jiong Deng and Hongwei Xie and Ming Lu and Kun Ma and Long Chen and Guang Chen and Hangjun Ye and Bing Wang and Haiyang Sun},
  journal= {arXiv preprint arXiv:2605.18137},
  year   = {2026}
}