DORSal:用于场景以对象为中心表示的扩散模型
计算机视觉与模式识别
2024-05-06 v3 人工智能
机器学习
摘要
近期3D场景理解的进展使得跨大规模多样场景数据集的可扩展表示学习成为可能。因此,对未见场景与对象的泛化、仅从单张或少量输入图像渲染新视角,以及支持编辑的可控场景生成如今皆可实现。然而,与单场景优化模型(如NeRF)相比,在大量场景上联合训练通常会折损渲染质量。本文中,我们利用扩散模型的最新进展,使3D场景表示学习模型具备高保真新视角渲染能力,同时较大程度保留如对象级场景编辑等优势。具体地,我们提出DORSal,其将视频扩散架构适配于以冻结的以对象为中心的基于槽的场景表示为条件的3D场景生成。在复杂合成多对象场景及真实世界大规模Street View数据集上,我们表明DORSal实现了具对象级编辑的可扩展神经渲染3D场景,并优于现有方法。
引用
@article{arxiv.2306.08068,
title = {DORSal: Diffusion for Object-centric Representations of Scenes et al},
author = {Allan Jabri and Sjoerd van Steenkiste and Emiel Hoogeboom and Mehdi S. M. Sajjadi and Thomas Kipf},
journal= {arXiv preprint arXiv:2306.08068},
year = {2024}
}
备注
Accepted to ICLR 2024. Project page: https://www.sjoerdvansteenkiste.com/dorsal