中文

基于实例掩码保持身份的驾驶世界模型生成

计算机视觉与模式识别 2026-02-11 v3

摘要

自动驾驶依赖于在大规模高质量多视角驾驶视频上训练的稳健模型。虽然世界模型提供了一种高效生成逼真驾驶数据的方法,但往往因缺乏实例级时序约束而导致同一对象在不同帧中出现外观或类别变化。我们引入ConsisDrive,一种设计用于在实例级别强制时序一致性的身份保持驾驶世界模型。我们的框架包含两个关键组件:(1)实例掩码注意力机制,对注意力块中的实例身份掩码和�迹掩码进行应用,确保视觉标记仅与其对应的实例特征在空间和时间维度上相互作用,从而保持对象身份的一致性;(2)实例掩码损失,通过概率实例掩码自适应强调前景区域,减少背景噪声同时保持整体场景保真度。通过整合这些机制,ConsisDrive实现了驾驶视频生成质量的领先水平,并在nuScenes数据集上 demonstrate了在下游自动驾驶任务中的显著改进。我们的项目页面为https://shanpoyang654.github.io/ConsisDrive/page.html。

关键词

引用

@article{arxiv.2602.03213,
  title  = {ConsisDrive: Identity-Preserving Driving World Models for Video Generation by Instance Mask},
  author = {Zhuoran Yang and Yanyong Zhang},
  journal= {arXiv preprint arXiv:2602.03213},
  year   = {2026}
}