中文

LatentEditor:文本驱动的 3D 场景局部编辑

计算机视觉与模式识别 2024-07-16 v4 人工智能

摘要

尽管神经场在视图合成和场景重建方面取得了显著进展,但由于其从多视图输入中隐式编码几何和纹理信息,编辑它们构成了一个艰巨的挑战。在本文中,我们介绍了 \textsc{LatentEditor},这是一个创新框架,旨在使用户能够使用文本提示对神经场进行精确且局部控制的编辑。我们利用去噪扩散模型,成功地将真实世界场景嵌入到潜在空间中,从而为编辑提供了一个比传统方法更快、适应性更强的 NeRF 骨干。为了增强编辑精度,我们引入了一个 delta 分数来计算潜在空间中的 2D 掩码,该掩码作为局部修改的引导,同时保留不相关区域。我们新颖的像素级评分方法利用 InstructPix2Pix (IP2P) 的能力来辨别潜在空间中 IP2P 条件噪声预测与无条件噪声预测之间的差异。然后,以 2D 掩码为条件的编辑后的潜在表示在训练集中被迭代更新,以实现 3D 局部编辑。与现有的 3D 编辑模型相比,我们的方法实现了更快的编辑速度和更优的输出质量,弥合了文本指令与潜在空间中高质量 3D 场景编辑之间的差距。我们在四个基准 3D 数据集 LLFF、IN2N、NeRFStudio 和 NeRF-Art 上展示了我们方法的优越性。项目页面:https://latenteditor.github.io/

关键词

引用

@article{arxiv.2312.09313,
  title  = {LatentEditor: Text Driven Local Editing of 3D Scenes},
  author = {Umar Khalid and Hasan Iqbal and Nazmul Karim and Jing Hua and Chen Chen},
  journal= {arXiv preprint arXiv:2312.09313},
  year   = {2024}
}

备注

Project Page: https://latenteditor.github.io/ ECCV 2024 Accepted Paper