中文

FreeInsert:无需空间先验的3D高斯场景中解耦文本引导物体插入

计算机视觉与模式识别 2025-11-11 v4

摘要

文本驱动的3D场景物体插入是一项新兴任务,它能够通过自然语言实现直观的场景编辑。然而,现有的基于2D编辑的方法通常依赖于空间先验,如2D掩码或3D边界框,并且它们难以确保插入物体的一致性。这些限制阻碍了实际应用中的灵活性和可扩展性。在本文中,我们提出了FreeInsert,这是一个新颖的框架,它利用包括多模态大语言模型(MLLMs)、大型生成模型(LGMs)和扩散模型在内的基础模型,将物体生成与空间放置解耦。这使得无需空间先验即可在3D场景中进行无监督且灵活的物体插入。FreeInsert从一个基于MLLM的解析器开始,该解析器从用户指令中提取结构化语义,包括物体类型、空间关系和附着区域。这些语义既指导了插入物体的重建以实现3D一致性,也指导了其自由度的学习。我们利用MLLMs的空间推理能力来初始化物体的姿态和尺度。一个分层的、空间感知的细化阶段进一步整合了空间语义和MLLM推断的先验,以增强放置效果。最后,使用插入物体图像来改善物体的外观,以提高视觉保真度。实验结果表明,FreeInsert在不依赖空间先验的情况下实现了语义连贯、空间精确且视觉逼真的3D插入,提供了用户友好且灵活的编辑体验。

关键词

引用

@article{arxiv.2505.01322,
  title  = {FreeInsert: Disentangled Text-Guided Object Insertion in 3D Gaussian Scene without Spatial Priors},
  author = {Chenxi Li and Weijie Wang and Qiang Li and Bruno Lepri and Nicu Sebe and Weizhi Nie},
  journal= {arXiv preprint arXiv:2505.01322},
  year   = {2025}
}

备注

Accepted by ACMMM2025, Our project webpage: https://tjulcx.github.io/FreeInsert/