中文

超越视角:基于全局注意力的多视角驾驶场景视频生成

计算机视觉与模式识别 2024-12-10 v2

摘要

为自动驾驶训练生成多视角视频近来备受关注,其挑战在于解决跨视角和跨帧的一致性。现有方法通常对空间、时间和视角维度应用解耦的注意力机制。然而,这些方法在维持跨维度一致性方面常常遇到困难,尤其是在处理在不同时间和视点出现的快速移动物体时。在本文中,我们提出CogDriving,一种用于合成高质量多视角驾驶视频的新型网络。CogDriving利用带有全局4D注意力模块的扩散Transformer架构,能够在空间、时间和视角维度上同时建立关联。我们还为CogDriving提出了一个轻量级控制器,即微控制器,它仅使用标准ControlNet参数的1.1%,就能实现对鸟瞰图布局的精确控制。为了增强对自动驾驶至关重要的物体实例的生成,我们提出了一个重加权学习目标,在训练过程中动态调整物体实例的学习权重。CogDriving在nuScenes验证集上展示了强大的性能,FVD分数达到37.8,突显了其生成逼真驾驶视频的能力。该项目可在 https://luhannan.github.io/CogDrivingPage/ 找到。

关键词

引用

@article{arxiv.2412.03520,
  title  = {Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention},
  author = {Hannan Lu and Xiaohe Wu and Shudong Wang and Xiameng Qin and Xinyu Zhang and Junyu Han and Wangmeng Zuo and Ji Tao},
  journal= {arXiv preprint arXiv:2412.03520},
  year   = {2024}
}