中文

VQA-Diff:基于 VQA 和扩散模型的自动驾驶中零样本图像到3D车辆资产生成

计算机视觉与模式识别 2024-07-12 v2

摘要

从野外观察中生成3D车辆资产对于自动驾驶至关重要。现有的图像到3D方法无法很好地解决此问题,因为它们仅从图像RGB信息中学习生成,而缺乏对野外车辆(如车型、制造商等)的深入理解。这导致其在处理遮挡或特殊视角角度的真实世界观察时,零样本预测能力较差。为解决这一问题,本文提出了VQA-Diff框架,利用野外车辆图像为自动驾驶创建逼真的3D车辆资产。VQA-Diff利用来自大型语言模型的视觉问答(VQA)模型中继承的真实世界知识,实现对零样本预测的稳健性;同时利用扩散模型中丰富的图像先验知识进行结构和外观生成。具体而言,我们采用多专家扩散模型策略生成结构信息,并运用面向主体的结构控制生成机制来建模外观信息。因此,无需从大规模来自真实世界的图像到3D车辆数据集中学习,VQA-Diff仍具备稳健的零样本图像到新视角生成能力。我们在Various数据集上进行实验,包括Pascal 3D+、Waymo和Objaverse,表明VQA-Diff在定性和定量分析上均优于现有最先进方法。

关键词

引用

@article{arxiv.2407.06516,
  title  = {VQA-Diff: Exploiting VQA and Diffusion for Zero-Shot Image-to-3D Vehicle Asset Generation in Autonomous Driving},
  author = {Yibo Liu and Zheyuan Yang and Guile Wu and Yuan Ren and Kejian Lin and Bingbing Liu and Yang Liu and Jinjun Shan},
  journal= {arXiv preprint arXiv:2407.06516},
  year   = {2024}
}