中文

GaussianEditor:基于文本指令精细编辑3D高斯

计算机视觉与模式识别 2024-07-25 v2 图形学

摘要

近来,基于2D扩散模型、利用文本指令进行3D场景编辑已取得令人印象深刻的成果。然而,当前的扩散模型主要通过在潜空间预测噪声来生成图像,且编辑通常应用于整幅图像,这使得对3D场景进行精细尤其是局部化的编辑颇具挑战。受近期3D Gaussian splatting启发,我们提出一个名为GaussianEditor的系统框架,通过3D高斯与文本指令精细编辑3D场景。得益于3D高斯的显式属性,我们设计了一系列技术以实现精细编辑。具体而言,我们首先提取与文本指令对应的感兴趣区域(RoI),并将其对齐到3D高斯。该高斯RoI进一步用于控制编辑过程。我们的框架能比以往方法实现对3D场景更精细、更精确的编辑,同时享有更快的训练速度,即在单块V100 GPU上20分钟内完成,比Instruct-NeRF2NeRF(45分钟–2小时)快一倍以上。

关键词

引用

@article{arxiv.2311.16037,
  title  = {GaussianEditor: Editing 3D Gaussians Delicately with Text Instructions},
  author = {Junjie Wang and Jiemin Fang and Xiaopeng Zhang and Lingxi Xie and Qi Tian},
  journal= {arXiv preprint arXiv:2311.16037},
  year   = {2024}
}

备注

CVPR 2024, Project page: https://GaussianEditor.github.io