中文

基于姿态条件数据集更新的语言驱动物体融合至神经辐射场

计算机视觉与模式识别 2024-04-02 v3

摘要

神经辐射场是一种新兴的渲染方法,它从神经场景表示和体渲染生成高质量的多视角一致图像。尽管基于神经辐射场的技术对场景重建具有鲁棒性,但它们添加或移除物体的能力仍然有限。本文提出一种通过数据集更新实现神经辐射场物体操控的新型语言驱动方法。具体而言,为了将一组多视角图像表示的新的前景物体插入背景辐射场,我们使用文本到图像扩散模型学习并生成跨视角将该目标物体融合到给定背景中的组合图像。这些组合图像随后用于细化背景辐射场,从而能够渲染包含该物体和背景的视角一致图像。为确保视角一致性,我们提出一种数据集更新策略,该策略优先使用靠近已训练视角的相机视角训练辐射场,然后再将训练传播到其余视角。我们表明,在相同的数据集更新策略下,我们可以轻松地将方法适配为利用来自文本到 3D 模型的数据进行物体插入以及物体移除。实验结果表明,我们的方法生成了编辑场景的照片级真实感图像,并在 3D 重建和神经辐射场混合方面优于最先进的方法。

关键词

引用

@article{arxiv.2309.11281,
  title  = {Language-driven Object Fusion into Neural Radiance Fields with Pose-Conditioned Dataset Updates},
  author = {Ka Chun Shum and Jaeyeon Kim and Binh-Son Hua and Duc Thanh Nguyen and Sai-Kit Yeung},
  journal= {arXiv preprint arXiv:2309.11281},
  year   = {2024}
}

备注

CVPR 2024