中文

ConsistDreamer:面向高保真场景编辑的 3D 一致 2D 扩散

计算机视觉与模式识别 2024-06-14 v1 人工智能 机器学习

摘要

本文提出 ConsistDreamer——一种新型框架,为 2D 扩散模型注入 3D 感知与 3D 一致性,从而实现高保真的指令导向场景编辑。为克服 2D 扩散模型缺乏 3D 一致性的根本限制,本文的关键洞察在于引入三种协同策略,增强 2D 扩散模型的输入以实现 3D 感知,并在训练过程中显式强制 3D 一致性。具体而言,我们将周围视角作为富有语境的输入喂给 2D 扩散模型,并生成 3D 一致且结构化的噪声,而非图像独立的噪声。此外,我们引入自监督一致性约束训练于每个场景的编辑过程中。广泛评估显示,ConsistDreamer 在各种场景和编辑指令下实现了最先进性能,尤其在来自 ScanNet++ 的复杂大型室内场景中表现突出,锐度和细粒度纹理显著提升。值得注意的是,ConsistDreamer 是首个能成功编辑复杂(如条纹/棋盘格)图案的工作。项目页面位于 immortalco.github.io/ConsistDreamer。

关键词

引用

@article{arxiv.2406.09404,
  title  = {ConsistDreamer: 3D-Consistent 2D Diffusion for High-Fidelity Scene Editing},
  author = {Jun-Kun Chen and Samuel Rota Bulò and Norman Müller and Lorenzo Porzi and Peter Kontschieder and Yu-Xiong Wang},
  journal= {arXiv preprint arXiv:2406.09404},
  year   = {2024}
}

备注

CVPR 2024