ConsistDreamer:面向高保真场景编辑的 3D 一致 2D 扩散
计算机视觉与模式识别
2024-06-14 v1 人工智能
机器学习
摘要
本文提出 ConsistDreamer——一种新型框架,为 2D 扩散模型注入 3D 感知与 3D 一致性,从而实现高保真的指令导向场景编辑。为克服 2D 扩散模型缺乏 3D 一致性的根本限制,本文的关键洞察在于引入三种协同策略,增强 2D 扩散模型的输入以实现 3D 感知,并在训练过程中显式强制 3D 一致性。具体而言,我们将周围视角作为富有语境的输入喂给 2D 扩散模型,并生成 3D 一致且结构化的噪声,而非图像独立的噪声。此外,我们引入自监督一致性约束训练于每个场景的编辑过程中。广泛评估显示,ConsistDreamer 在各种场景和编辑指令下实现了最先进性能,尤其在来自 ScanNet++ 的复杂大型室内场景中表现突出,锐度和细粒度纹理显著提升。值得注意的是,ConsistDreamer 是首个能成功编辑复杂(如条纹/棋盘格)图案的工作。项目页面位于 immortalco.github.io/ConsistDreamer。
引用
@article{arxiv.2406.09404,
title = {ConsistDreamer: 3D-Consistent 2D Diffusion for High-Fidelity Scene Editing},
author = {Jun-Kun Chen and Samuel Rota Bulò and Norman Müller and Lorenzo Porzi and Peter Kontschieder and Yu-Xiong Wang},
journal= {arXiv preprint arXiv:2406.09404},
year = {2024}
}
备注
CVPR 2024