ED-NeRF:基于隐空间 NeRF 的高效文本引导 3D 场景编辑
计算机视觉与模式识别
2024-03-22 v2 人工智能
机器学习
机器学习
摘要
近来,文本到图像扩散模型取得重大进展,在 2D 图像生成中实现了突破性性能。这些进展已扩展到 3D 模型,能够从文本描述生成新颖的 3D 物体。这演变为 NeRF 编辑方法,允许通过文本条件操控现有 3D 物体。然而,现有 NeRF 编辑技术由于训练速度慢以及所使用的损失函数未充分考量编辑而面临性能局限。为此,我们提出一种新颖的 3D NeRF 编辑方法 ED-NeRF,通过独特的细化层将真实世界场景成功嵌入潜扩散模型(LDM)的隐空间中。该方法使我们获得一个相比传统图像空间 NeRF 编辑更快且更易于编辑的 NeRF 主干。此外,我们通过将最初用于 2D 图像编辑的 delta denoising score(DDS)蒸馏损失迁移到三维领域,提出了一种为编辑量身改进的损失函数。该新颖损失函数在编辑适用性上超越了著名的 score distillation sampling(SDS)损失。实验结果表明,与最先进的 3D 编辑模型相比,ED-NeRF 实现了更快的编辑速度并生成更优的输出质量。
引用
@article{arxiv.2310.02712,
title = {ED-NeRF: Efficient Text-Guided Editing of 3D Scene with Latent Space NeRF},
author = {Jangho Park and Gihyun Kwon and Jong Chul Ye},
journal= {arXiv preprint arXiv:2310.02712},
year = {2024}
}
备注
ICLR 2024; Project Page: https://jhq1234.github.io/ed-nerf.github.io/