中文

ArbiViewGen:基于Stable Diffusion模型的任意视点自动驾驶相机数据可控生成

计算机视觉与模式识别 2025-08-08 v1

摘要

任意视点图像生成对于自动驾驶具有重要潜力,但由于缺乏对 extrapolated 视图的真实数据,限制了高保真生成模型的训练。本文提出Arbiviewgen,一个基于扩散模型的用于生成任意视点可控相机图像的框架。为解决未见视角缺乏真实数据的问题,本文引入两个关键组件:特征感知自适应视角拼接(FAVS)和跨视图一致性自监督学习(CVC-SSL)。FAVS采用分层匹配策略,首先利用相机姿态建立粗糙的几何对应,然后通过改进的特征匹配算法进行细粒度对齐,并通过聚类分析识别高置信度匹配区域。基于此,CVC-SSL采用自监督训练范式,使模型从合成的拼接图像重建原始相机视图,以无需 extrapolated 数据监督的方式实现跨视图一致性。我们的框架仅需多摄像头图像及其关联姿态即可完成训练,无需额外传感器或深度图。就目前而言,Arbiviewgen是首个能够在多种车辆配置下实现任意视点相机图像可控生成的方法。

关键词

引用

@article{arxiv.2508.05236,
  title  = {ArbiViewGen: Controllable Arbitrary Viewpoint Camera Data Generation for Autonomous Driving via Stable Diffusion Models},
  author = {Yatong Lan and Jingfeng Chen and Yiru Wang and Lei He},
  journal= {arXiv preprint arXiv:2508.05236},
  year   = {2025}
}

备注

11 pages, 6 figures