3DitScene:通过语言引导的解缠高斯溅射进行场景编辑
计算机视觉与模式识别
2024-05-29 v1
摘要
场景图像编辑对于娱乐、摄影和广告设计至关重要。现有方法仅专注于2D 单个物体或3D 全局场景编辑,导致缺乏统一的方法来有效控制和操作在不同细节级别下的3D 场景。在本工作中,我们提出了 3DitScene,一种新型统一的场景编辑框架,利用语言引导的解缠高斯溅射(language-guided disentangled Gaussian Splatting),实现从2D 到3D 的无缝编辑,允许对场景构图和单个物体进行精确控制。我们首先引入通过生成先验和优化技术细化的3D 高斯。语言特征来自 CLIP 然后为对象的解缠引入语义信息到3D 几何中。通过解缠的高斯,3DitScene 允许在全局和单个级别进行操作,彻底变革了创造表达,赋能对场景和物体的控制。实验结果表明,3DitScene 在场景图像编辑方面有效且多功能。代码和在线演示可在项目主页找到:https://zqh0253.github.io/3DitScene/。
引用
@article{arxiv.2405.18424,
title = {3DitScene: Editing Any Scene via Language-guided Disentangled Gaussian Splatting},
author = {Qihang Zhang and Yinghao Xu and Chaoyang Wang and Hsin-Ying Lee and Gordon Wetzstein and Bolei Zhou and Ceyuan Yang},
journal= {arXiv preprint arXiv:2405.18424},
year = {2024}
}