UrbanGIRAFFE:将城市场景表示为组合式生成神经特征场
计算机视觉与模式识别
2023-03-29 v2
摘要
生成具有可控相机位姿与场景内容的光照片级真实图像,对包括 AR/VR 与仿真在内的许多应用至关重要。尽管 3D 感知生成模型已取得快速进展,多数现有方法聚焦于以物体为中心的图像,不适用于生成城市场景以实现自由相机视角控制与场景编辑。为应对这一挑战性任务,我们提出 UrbanGIRAFFE,其利用粗粒度 3D 全景先验(包括不可数“背景物”与可数物体的布局分布)来引导 3D 感知生成模型。我们的模型具有组合性与可控性,将场景分解为背景物、物体与天空。以语义体素网格形式使用背景物先验,我们构建了条件化的背景物生成器,有效融入粗粒度语义与几何信息。物体布局先验进一步使我们能从杂乱场景中学习物体生成器。借助恰当的损失函数,我们的方法促进了具有多样可控性的光照片级真实 3D 感知图像合成,包括大幅相机移动、背景物编辑与物体操控。我们在合成与真实世界数据集(包括具挑战性的 KITTI-360 数据集)上验证了模型的有效性。
引用
@article{arxiv.2303.14167,
title = {UrbanGIRAFFE: Representing Urban Scenes as Compositional Generative Neural Feature Fields},
author = {Yuanbo Yang and Yifei Yang and Hanlei Guo and Rong Xiong and Yue Wang and Yiyi Liao},
journal= {arXiv preprint arXiv:2303.14167},
year = {2023}
}
备注
Project page: https://lv3d.github.io/urbanGIRAFFE