中文

VGGT-Edit:基于残差场预测的前馈式原生 3D 场景编辑

计算机视觉与模式识别 2026-05-20 v2 人工智能

摘要

高质量的 3D 场景重建最近进步 toward通用可前馈的架构,使能够在单次前向传递中生成复杂环境。然而,尽管这些模型在静态场景感知方面表现优异,但在响应动态人类指令方面仍受限,这限制了其在交互应用中的使用。现有编辑方法通常依赖 2D-提升策略,独立编辑各个视角,然后提升回 3D 空间。这种间接管道常导致纹理模糊和几何不一致,因为 2D 编辑器缺乏所需的空间感知来跨视角保持结构。为此,我们提出了 VGGT-Edit,一个用于文本条件的原生 3D 场景编辑的前馈框架。VGGT-Edit 引入深度同步文本注入,将语义指导与背板的空间姿态对齐,以确保指令 grounding 稳定。该语义信号随后由残差变换头处理器直接预测 3D 几何位移,以变形场景同时保持背景稳定。为确保高保真度结果,我们使用多项目标函数对框架进行监督,以强制几何准确性和跨视角一致性。我们还构建了 DeltaScene 数据集,通过自动化管道生成的大规模数据集,并通过 3D 一致性筛选确保数据集质量。实验表明,VGGT-Edit 在锐利的对象细节、强大的多视角一致性和近乎即时的推断速度方面显著优于 2D-提升基线。项目页面为 https://chriszkxxx.github.io/VGGT-Edit/。

关键词

引用

@article{arxiv.2605.15186,
  title  = {VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction},
  author = {Kaixin Zhu and Yiwen Tang and Yifan Yang and Renrui Zhang and Bohan Zeng and Ziyu Guo and Ruichuan An and Zhou Liu and Qizhi Chen and Delin Qu and Jaehong Yoon and Wentao Zhang},
  journal= {arXiv preprint arXiv:2605.15186},
  year   = {2026}
}