迈向免训练的3D场景编辑方法
计算机视觉与模式识别
2024-12-18 v1
摘要
文本驱动的扩散模型在图像编辑方面展现了卓越的能力。然而,在编辑3D场景时,现有工作大多依赖于训练NeRF进行3D编辑。最近的NeRF编辑方法通过部署2D扩散模型并利用编辑操作,将这些编辑投影到3D空间中。它们需要强位置先验以及文本提示来识别编辑位置。这些方法适用于小型3D场景,并且更针对特定场景。它们需要针对每次特定编辑进行训练,无法用于实时编辑。为了解决这些局限性,我们提出了一种新颖的方法FreeEdit,以免训练的方式使用网格表示作为NeRF的替代品进行编辑。由于基础模型空间的发展,免训练方法现在成为可能。我们利用这些模型提供一种免训练的替代方案,并引入了插入、替换和删除的解决方案。我们将插入、替换和删除视为通过某些操作组合执行复杂编辑的基本模块。给定文本提示和3D场景,我们的模型能够识别应该插入/替换或删除的对象以及执行编辑的位置。我们还引入了FreeEdit中的一种新颖算法,用于在基础对象上找到放置的最佳位置。我们通过定量和定性指标在广泛场景上与基线模型进行比较来评估我们的模型,并展示了我们方法相对于其他方法的优势。
引用
@article{arxiv.2412.12766,
title = {Towards a Training Free Approach for 3D Scene Editing},
author = {Vivek Madhavaram and Shivangana Rawat and Chaitanya Devaguptapu and Charu Sharma and Manohar Kaul},
journal= {arXiv preprint arXiv:2412.12766},
year = {2024}
}