中文

GenieDrive:面向物理感知驾驶世界模型的4D占用引导视频生成

计算机视觉与模式识别 2025-12-16 v1

摘要

物理感知驾驶世界模型对于驾驶规划、分布外数据合成和闭环评估至关重要。然而,现有方法通常依赖单一扩散模型直接将驾驶动作映射为视频,这使得学习困难并导致物理不一致的输出。为克服这些挑战,我们提出了 GenieDrive,一个专为物理感知驾驶视频生成设计的新型框架。我们的方法首先生成4D占用,作为后续视频生成的物理信息基础。4D占用包含丰富的物理信息,包括高分辨率三维结构和动力学。为了有效压缩此类高分辨率占用,我们提出了一种将占用编码为潜在三平面表示的变分自编码器(VAE),将潜在大小缩减至先前方法的仅58%。我们进一步引入互控制注意力(Mutual Control Attention, MCA)以精确建模控制对占用演化的影响,并以端到端方式联合训练VAE和后续预测模块以最大化预测精度。这些设计共同实现了7.2%的预测mIoU提升,推理速度为41 FPS,仅使用3.47 M参数。此外,在视频生成模型中引入了归一化多视角注意力(Normalized Multi-View Attention),以我们的4D占用为引导生成多视角驾驶视频,显著提升了视频质量,FVD降低了20.7%。实验表明,GenieDrive实现了高可控性、多视角一致性和物理感知的驾驶视频生成。

关键词

引用

@article{arxiv.2512.12751,
  title  = {GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation},
  author = {Zhenya Yang and Zhe Liu and Yuxiang Lu and Liping Hou and Chenxuan Miao and Siyi Peng and Bailan Feng and Xiang Bai and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2512.12751},
  year   = {2025}
}

备注

The project page is available at https://huster-yzy.github.io/geniedrive_project_page/