InseRF:神经 3D 场景中文本驱动的生成式物体插入
计算机视觉与模式识别
2024-01-11 v1 图形学
机器学习
摘要
我们介绍了 InseRF,这是一种在 3D 场景的 NeRF 重建中进行生成式物体插入的新方法。基于用户提供的文本描述和参考视角中的 2D 边界框,InseRF 能在 3D 场景中生成新物体。最近,由于在 3D 生成建模中使用了强大的文本到图像扩散模型先验,3D 场景编辑方法发生了深刻变革。现有方法大多能有效通过风格和外观变化编辑 3D 场景或移除现有物体,然而生成新物体对此类方法仍具挑战,本研究旨在解决这一问题。具体而言,我们提议将 3D 物体插入锚定到场景参考视角中的 2D 物体插入。然后利用单视角物体重建方法将 2D 编辑提升至 3D。重建后的物体在单目深度估计方法先验的引导下插入场景中。我们在各种 3D 场景中评估了该方法,并对所提出的组件进行了深入分析。我们在多个 3D 场景中进行的生成式物体插入实验表明,与现有方法相比,我们的方法是有效的。InseRF 能够实现可控且 3D 一致的物体插入,无需显式的 3D 信息作为输入。请访问我们的项目页面:https://mohamad-shahbazi.github.io/inserf。
引用
@article{arxiv.2401.05335,
title = {InseRF: Text-Driven Generative Object Insertion in Neural 3D Scenes},
author = {Mohamad Shahbazi and Liesbeth Claessens and Michael Niemeyer and Edo Collins and Alessio Tonioni and Luc Van Gool and Federico Tombari},
journal= {arXiv preprint arXiv:2401.05335},
year = {2024}
}