中文

Instructive3D:基于文本指令的大规模3D重建模型编辑

计算机视觉与模式识别 2025-01-09 v1

摘要

基于Transformer的方法已使用户能够创建、修改和理解文本和图像数据。最近提出的大规模重建模型(Large Reconstruction Models, LRMs)进一步扩展了这一能力,通过单张物体图像生成高质量3D模型。然而,这些模型缺乏对更细粒度细节的操控和编辑能力,例如添加标准设计图案或更改生成对象的颜色和光泽,从而缺乏在增强现实、动画和游戏等领域可能非常有帮助的细粒度控制。直接训练LRMs以实现此目的需要生成精确编辑后的图像和3D物体对,这在计算上代价高昂。本文提出一种名为 Instructive3D 的新型LRM模型,将3D对象的生成与通过用户文本提示进行细粒度编辑集成到单个模型中。我们通过添加一个适配器,在3D物体模型的三平面潜在空间表示中进行条件扩散过程,以文本提示指定编辑。我们的方法无需生成编辑后的3D物体。此外,Instructive3D 允许我们进行几何一致的修改,因为通过用户定义的文本提示所做的编辑被应用于三平面潜在表示,从而增强了生成3D物体的灵活性和精确度。我们与一个基线模型进行比较,该基线模型首先使用标准LRM模型生成3D物体网格,然后在提供图像时使用文本提示编辑这些3D物体。实验在 Objaverse LVIS 数据集上进行,我们发现 Instructive3D 生成的3D物体在满足编辑提示指定的属性方面在质量上具有优势。

关键词

引用

@article{arxiv.2501.04374,
  title  = {Instructive3D: Editing Large Reconstruction Models with Text Instructions},
  author = {Kunal Kathare and Ankit Dhiman and K Vikas Gowda and Siddharth Aravindan and Shubham Monga and Basavaraja Shanthappa Vandrotti and Lokesh R Boregowda},
  journal= {arXiv preprint arXiv:2501.04374},
  year   = {2025}
}

备注

Accepted at WACV 2025. First two authors contributed equally