中文

BEV-VAE:面向自动驾驶的多视角图像生成及其空间一致性

计算机视觉与模式识别 2025-07-02 v1

摘要

自动驾驶中的多视角图像生成要求跨摄像机视角实现一致的3D场景理解。现有大多数方法将此问题视为2D图像集生成任务,缺乏显式的3D建模。然而,我们认为结构化表征对场景生成至关重要,尤其是针对自动驾驶应用。本文提出BEV-VAE以实现一致且可控的视角合成。BEV-VAE首先训练一个多视角图像变分自编码器,以构建紧凑且统一的BEV潜在空间,然后通过潜在扩散变换器生成场景。BEV-VAE支持给定相机配置的任意视角生成,亦可选性地输入3D布局。实验在nuScenes和Argoverse 2 (AV2)数据集上表现出色,在3D一致重建和生成方面均表现突出。代码已公开:https://github.com/Czm369/bev-vae。

关键词

引用

@article{arxiv.2507.00707,
  title  = {BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving},
  author = {Zeming Chen and Hang Zhao},
  journal= {arXiv preprint arXiv:2507.00707},
  year   = {2025}
}