中文

Vinedresser3D:基于代理的文本引导3D编辑

计算机视觉与模式识别 2026-02-24 v1

摘要

文本引导3D编辑旨在使用自然语言指令修改现有3D资产。当前方法在 jointly understanding complex prompts、自动在3D中局部化编辑以及保持未编辑内容方面存在挑战。我们引入 Vinedresser3D,一个用于高质量文本引导3D编辑的 agentic 框架,直接在原生3D生成模型的 latent 空间中运行。给定3D资产和编辑指令,Vinedresser3D 使用多模态大语言模型推断原始资产的丰富描述,识别编辑区域和编辑类型 (添加、修改、删除),并生成分解的结构和外观层次文本指导。代理随后选择一个信息丰富的视图并应用图像编辑模型获取视觉指导。最后,一个基于 inversion 的 rectified-flow inpainting 管道配合交错采样模块在3D latent 空间中执行编辑,在保持3D 连贯性和未编辑区域的同时实现 prompt 对齐。针对多样化的3D编辑,实验表明 Vinedresser3D 在自动评估指标和人类偏好研究中均优于先前基线,同时实现了精确、连贯且无掩码的3D编辑。

关键词

引用

@article{arxiv.2602.19542,
  title  = {Vinedresser3D: Agentic Text-guided 3D Editing},
  author = {Yankuan Chi and Xiang Li and Zixuan Huang and James M. Rehg},
  journal= {arXiv preprint arXiv:2602.19542},
  year   = {2026}
}

备注

CVPR 2026, Project website:https://vinedresser3d.github.io/